> ## Content Index
> Fetch the complete content index at: https://lucent.blog/llms.txt
> Use this file to discover other available public pages before exploring further.

# DeepSeek-V4-Flash-Vision-Exp vs Qwen3.8-Flash-Next：新一代开源模型该怎么选？
- URL: https://lucent.blog/deepseek-v4-flash-vision-exp-vs-qwen3-8-flash-next/
- Published: 2026-09-05T11:59:27.000Z
- Updated: 2026-09-05T12:05:55.000Z
- Author: Lucent
- Tags: AI, 大模型

2026 年下半年，开源大模型又迎来了一轮明显的架构升级。

DeepSeek 推出了首个 V4 多模态实验模型 **DeepSeek-V4-Flash-Vision-Exp**，Qwen 则发布了带有下一代 Qwen4 架构预览性质的 **Qwen3.8-Flash-Next**。

这两个模型有不少相似之处：都是 MoE、都支持思考、都支持视觉输入、都面向 Coding 与 Agent 场景，而且都可以通过 vLLM 私有化部署。

但真正深入使用后会发现，它们其实走了两条很不一样的路线。

一句话概括：

> **Qwen3.8-Flash-Next 更像一个追求综合能力与推理效率的“通用 Agent 模型”；DeepSeek-V4-Flash-Vision-Exp 则更像一个面向 Coding、工具调用和超长上下文的“工程型模型”。**

截至 2026 年 9 月，第三方 Artificial Analysis 的综合 Intelligence Index 给 Qwen3.8-Flash-Next 56 分、DeepSeek-V4-Flash-Vision-Exp 51 分。不过在输出速度和上下文长度上，DeepSeek 又明显占优。

## 一、先看基本规格

| 项目                 | DeepSeek-V4-Flash-Vision-Exp | Qwen3.8-Flash-Next              |
| ------------------ | ---------------------------- | ------------------------------- |
| 架构                 | MoE                          | MoE                             |
| 总体规模               | 约 285B                       | 125B 主模型 + 51B N-gram Embedding |
| 每 Token 激活参数       | 13B                          | **6B**                          |
| 原生上下文              | **1,048,576**                | 262,144                         |
| 图像输入               | 支持                           | 支持                              |
| 视频输入               | —                            | **支持**                          |
| Thinking           | 支持                           | 支持                              |
| Tool Calling       | 支持                           | 支持                              |
| DeepSeek/Qwen 特有结构 | CSA、Hyper-Connections、DSpark | GDN、QSA、N-gram Embedding、MTP    |
| License            | **MIT**                      | Qwen Community License 1.0      |

DeepSeek V4 Vision 基于约 285B/13B Active 的 V4 MoE 主干，包含 256 个 routed experts，每个 Token 激活其中 6 个，同时加入 32 层视觉编码器，并原生提供 1,048,576 Token 上下文。

Qwen3.8-Flash-Next 则采用了更加激进的稀疏设计：125B 主模型之外，再增加约 51B 的 N-gram Embedding，但推理时每个 Token 只激活约 **6B 参数**。其核心架构由 Gated DeltaNet、Qwen Sparse Attention、N-gram Embedding 和 MTP 组成。

仅从架构来看，Qwen 的方向非常明确：

> **尽可能增加模型容量，但不要让这些容量全部变成每个 Token 的计算量。**

而 DeepSeek 的思路则更倾向于：

> **保持更大的有效模型容量，同时围绕 Attention、MoE、Speculative Decoding 和长上下文继续优化。**

# 二、综合能力：Qwen 当前略占优势

目前最容易直接横向观察的数据来自 Artificial Analysis。

在相同的高强度 Reasoning 对比下：

| 指标                 | Qwen3.8-Flash-Next | DeepSeek V4 Vision |
| ------------------ | ------------------ | ------------------ |
| Intelligence Index | **56**             | 51                 |
| 输出速度               | 约 69～76 tok/s      | **约 120 tok/s**    |
| TTFT               | 2.74 秒             | **约 1.08 秒**       |
| Context            | 256K               | **1M**             |

所以如果只看综合 Benchmark：

**Qwen 当前领先。**

但值得注意的是，这并不是一个“Qwen 全面胜出”的结果。

DeepSeek 的响应速度和首 Token 延迟反而明显更低，而且拥有四倍左右的原生上下文长度。

另外，这里的速度来自第三方托管 API，受到硬件、Batch、量化方式、Provider 调度等因素影响。

# 三、Coding：两者差距其实非常小

对于这两个模型，Coding 是最值得关注的部分。

Qwen3.8-Flash-Next 官方公布的数据相当漂亮：

| Benchmark              | Qwen3.8-Flash-Next |
| ---------------------- | ------------------ |
| DeepSWE 1.1            | 58.7               |
| SWE-bench Pro          | **62.5**           |
| SWE-bench Multilingual | **81.0**           |
| NL2Repo                | 48.1               |
| LiveCodeBench v6       | **91.9**           |
| Toolathlon             | 73.5               |

尤其是 SWE-bench Pro 62.5 和 LiveCodeBench 91.9，说明它不仅擅长生成代码，在真实软件工程任务中同样具备很强的竞争力。

但 DeepSeek-V4-Flash-Vision-Exp 也非常有意思。

DeepSeek 官方给出的 Agent/Coding 数据是：

| Benchmark           | DeepSeek V4 Vision |
| ------------------- | ------------------ |
| Terminal Bench 2.1  | **83.9**           |
| NL2Repo             | **57.7**           |
| DeepSWE             | **59.3**           |
| Toolathlon Verified | **75.9**           |
| DSBench-Hard        | 63.6               |
| AutomationBench     | 25.7               |

单看这些数字，会发现 DeepSeek 在 Repo、Terminal、Tool Use 这类偏 Agentic Coding 的任务中非常强。

例如 DeepSWE：

- Qwen：58.7
- DeepSeek：59.3

Toolathlon：

- Qwen：73.5
- DeepSeek：75.9

NL2Repo：

- Qwen：48.1
- DeepSeek：57.7

需要注意，不同厂商公布的数据在 Agent Harness、Prompt 和执行环境上并不完全一致，因此不适合直接用 0.x 分判断胜负。

但至少可以得出一个比较明确的结论：

> **这两个模型的 Coding 能力已经处于同一个水平区间。**

如果是传统代码生成、SWE-bench、跨语言软件工程，我会更倾向 Qwen。

如果是类似 Claude Code、Codex、OpenCode 这种：

```text
读取项目
  ↓
搜索代码
  ↓
执行 Shell
  ↓
观察日志
  ↓
修改代码
  ↓
重新执行

```

的长流程 Coding Agent，DeepSeek V4 Vision 非常值得重视。

# 四、Agent：Qwen 更全面，DeepSeek 更偏工程

Qwen3.8-Flash-Next 一个非常明显的特点，就是它并没有只针对 Coding Agent 做优化。

它的 Agent Benchmark 覆盖范围相当广：

| Benchmark         | Qwen3.8-Flash-Next |
| ----------------- | ------------------ |
| CoWorkBench       | **73.9**           |
| JobBench          | **55.7**           |
| Agents' Last Exam | 24.3 Pass@1        |
| Toolathlon        | 73.5               |

其中 CoWorkBench 涵盖计算机、金融、法律等长流程办公任务。

因此 Qwen 更适合：

- 企业办公 Agent
- 资料整理
- 多工具协作
- Web Agent
- Coding Agent
- Research Agent
- 通用数字员工

而 DeepSeek 的优势方向更加集中：

- Terminal
- Shell
- Repo
- Coding
- 工具调用
- 自动化执行

这意味着，如果要构建服务器故障诊断 Agent：

```text
收到告警
 ↓
SSH 登录服务器
 ↓
查看日志
 ↓
执行诊断命令
 ↓
分析结果
 ↓
继续调用工具
 ↓
形成修复方案

```

DeepSeek-V4-Flash-Vision-Exp 会是一个非常值得测试的模型。

而如果要构建一个企业内部“万能 Agent”，Qwen 的能力覆盖范围则更完整。

# 五、多模态：Qwen 更完整，DeepSeek 更高效

两者现在都已经不是纯文本模型。

但 Qwen 在多模态上的覆盖范围明显更广。

Qwen3.8-Flash-Next 原生支持：

```text
Text
Image
Video

```

官方甚至直接给出了 Video Input 的 OpenAI API 调用方式。

其视觉 Agent 数据也相当突出：

| Benchmark           | Qwen3.8-Flash-Next |
| ------------------- | ------------------ |
| ClawEval-MM         | 64.4 Pass@3        |
| AndroidWorld        | **84.5**           |
| OSWorld 2.0 Partial | 52.3               |
| Vision2Web          | 64.0               |
| LVBench             | 76.6               |
| RealWorldQA         | 88.5               |
| MathVision          | 90.6               |

这些 Benchmark 已经明显超出了传统的“看图回答问题”，而是在测试：

**看见界面 → 理解界面 → 操作应用。**

所以如果未来要做 Computer Use，例如：

```text
截图
 ↓
理解 UI
 ↓
判断按钮
 ↓
执行点击
 ↓
再次截图
 ↓
继续操作

```

Qwen3.8-Flash-Next 会更有吸引力。

DeepSeek-V4-Flash-Vision-Exp 的视觉能力则更强调 Agent、OCR、Chart 和 Screenshot。

其官方结果包括：

- ApexBench：36.5
- Agents' Last Exam：27.3
- Chartography：64.3
- ZeroBench：35.0

而且它有一个非常特别的优势：

**每张图片最多大约只需要 387 个 Prompt Token。**

这对 Screenshot Agent 很有意义。

比如一次给模型输入 20 张服务器监控截图、网页截图或者报表，并不会像一些传统 VLM 一样迅速消耗掉大量上下文。

所以可以简单理解为：

> **Qwen：多模态能力更全面。** 
>  
> **DeepSeek：图片 Token 效率非常有吸引力。**

# 六、长上下文：DeepSeek 是明显优势项

DeepSeek-V4-Flash-Vision-Exp：

**1,048,576 Token 原生上下文。**

Qwen3.8-Flash-Next：

**262,144 Token 原生上下文。**

Qwen 可以通过 YaRN 将上下文扩展至约 1M，但这属于 RoPE Scaling，而不是模型的原生长度。Qwen 官方也明确建议在将 YaRN 作为默认配置前，测试其对短上下文质量的影响。

因此如果场景是：

- 巨型代码仓库
- 大量技术文档
- 长时间 Agent 历史
- 大型 RAG Context
- 数百份合同/报告
- 超长日志

DeepSeek 的优势非常明显。

当然，“模型支持 1M”不等于“部署时应该直接把 KV Cache 配成 1M”。

vLLM 对 DeepSeek Vision 当前公开验证的 reference run 实际只使用了 **32K `max-model-len`**，官方也特别提醒 1M KV Cache 所需要的显存远高于模型权重本身。

# 七、推理效率：Qwen 的架构更加激进

如果只从每 Token 计算量看：

```text
DeepSeek V4 Vision
13B Active Parameters

Qwen3.8 Flash Next
6B Active Parameters

```

Qwen 几乎只有一半。

但 Qwen 并没有简单缩小模型。

它增加了一个巨大的：

**51B N-gram Embedding**

作为类似长期 Lookup Memory 的结构。

这部分参数可以增加模型容量，却不需要像普通 Transformer 权重一样在每个 Token 上做大规模矩阵计算。

同时 Qwen 使用：

```text
Gated DeltaNet
      ↓
压缩历史状态

Qwen Sparse Attention
      ↓
精确访问长距离 Token

N-gram Embedding
      ↓
提供大容量 Lookup Memory

MoE
      ↓
仅激活 6B

```

这其实比单纯追求“大参数模型”更值得关注。

Qwen3.8-Flash-Next 本质上是在尝试解决一个问题：

> **如何继续提高模型容量，但不要让推理成本同比增长？**

从下一代大模型架构的发展方向来看，我认为这是 Qwen3.8-Flash-Next 最有价值的地方之一。

# 八、两者的思考模式也很不一样

DeepSeek V4 的 reasoning effort 分为：

```text
low
high
max

```

并通过 `chat_template_kwargs` 控制。DeepSeek 官方评测使用的是 `max`。

Qwen3.8-Flash-Next 则分为：

```text
low
medium
xhigh

```

而且默认：

```text
enable_thinking = true
reasoning_effort = xhigh
preserve_thinking = true

```

也就是说 Qwen 默认直接使用最高思考强度。

# 九、最终应该怎么选？

如果只能从两个模型中选择一个，我目前更倾向：

## Qwen3.8-Flash-Next

原因不是它在 Coding 上碾压 DeepSeek——实际上两者 Coding 非常接近。

真正的原因是 Qwen 的能力覆盖面更完整：

```text
强 Coding
+
强 Agent
+
图片
+
视频
+
Computer Use
+
262K Context
+
6B Active Parameters

```

第三方 Artificial Analysis 当前综合 Intelligence Index 也更偏向 Qwen。

但如果具体到以下场景：

### 大型 Repo / 超长文档

选：

**DeepSeek-V4-Flash-Vision-Exp**

### Terminal / DevOps Agent

优先测试：

**DeepSeek-V4-Flash-Vision-Exp**

### 普通 Coding

两者都可以，略倾向：

**Qwen3.8-Flash-Next**

### 通用企业 Agent

选：

**Qwen3.8-Flash-Next**

### Computer Use / UI Agent

选：

**Qwen3.8-Flash-Next**

### 视频理解

选：

**Qwen3.8-Flash-Next**

### OCR / Chart / 大量 Screenshot

非常值得测试：

**DeepSeek-V4-Flash-Vision-Exp**

### \>256K 超长上下文

明显选择：

**DeepSeek-V4-Flash-Vision-Exp**