Lucent's Blog

Lucent's Blog

当时明月在 曾照彩云归


人生不相见,动如参与商。


DeepSeek-V4-Flash-Vision-Exp vs Qwen3.8-Flash-Next:新一代开源模型该怎么选?

DeepSeek-V4-Flash-Vision-Exp vs Qwen3.8-Flash-Next:新一代开源模型该怎么选?

2026 年下半年,开源大模型又迎来了一轮明显的架构升级。

DeepSeek 推出了首个 V4 多模态实验模型 DeepSeek-V4-Flash-Vision-Exp,Qwen 则发布了带有下一代 Qwen4 架构预览性质的 Qwen3.8-Flash-Next

这两个模型有不少相似之处:都是 MoE、都支持思考、都支持视觉输入、都面向 Coding 与 Agent 场景,而且都可以通过 vLLM 私有化部署。

但真正深入使用后会发现,它们其实走了两条很不一样的路线。

一句话概括:

Qwen3.8-Flash-Next 更像一个追求综合能力与推理效率的“通用 Agent 模型”;DeepSeek-V4-Flash-Vision-Exp 则更像一个面向 Coding、工具调用和超长上下文的“工程型模型”。

截至 2026 年 9 月,第三方 Artificial Analysis 的综合 Intelligence Index 给 Qwen3.8-Flash-Next 56 分、DeepSeek-V4-Flash-Vision-Exp 51 分。不过在输出速度和上下文长度上,DeepSeek 又明显占优。

一、先看基本规格

项目DeepSeek-V4-Flash-Vision-ExpQwen3.8-Flash-Next
架构MoEMoE
总体规模约 285B125B 主模型 + 51B N-gram Embedding
每 Token 激活参数13B6B
原生上下文1,048,576262,144
图像输入支持支持
视频输入支持
Thinking支持支持
Tool Calling支持支持
DeepSeek/Qwen 特有结构CSA、Hyper-Connections、DSparkGDN、QSA、N-gram Embedding、MTP
LicenseMITQwen Community License 1.0

DeepSeek V4 Vision 基于约 285B/13B Active 的 V4 MoE 主干,包含 256 个 routed experts,每个 Token 激活其中 6 个,同时加入 32 层视觉编码器,并原生提供 1,048,576 Token 上下文。

Qwen3.8-Flash-Next 则采用了更加激进的稀疏设计:125B 主模型之外,再增加约 51B 的 N-gram Embedding,但推理时每个 Token 只激活约 6B 参数。其核心架构由 Gated DeltaNet、Qwen Sparse Attention、N-gram Embedding 和 MTP 组成。

仅从架构来看,Qwen 的方向非常明确:

尽可能增加模型容量,但不要让这些容量全部变成每个 Token 的计算量。

而 DeepSeek 的思路则更倾向于:

保持更大的有效模型容量,同时围绕 Attention、MoE、Speculative Decoding 和长上下文继续优化。

二、综合能力:Qwen 当前略占优势

目前最容易直接横向观察的数据来自 Artificial Analysis。

在相同的高强度 Reasoning 对比下:

指标Qwen3.8-Flash-NextDeepSeek V4 Vision
Intelligence Index5651
输出速度约 69~76 tok/s约 120 tok/s
TTFT2.74 秒约 1.08 秒
Context256K1M

所以如果只看综合 Benchmark:

Qwen 当前领先。

但值得注意的是,这并不是一个“Qwen 全面胜出”的结果。

DeepSeek 的响应速度和首 Token 延迟反而明显更低,而且拥有四倍左右的原生上下文长度。

另外,这里的速度来自第三方托管 API,受到硬件、Batch、量化方式、Provider 调度等因素影响。

三、Coding:两者差距其实非常小

对于这两个模型,Coding 是最值得关注的部分。

Qwen3.8-Flash-Next 官方公布的数据相当漂亮:

BenchmarkQwen3.8-Flash-Next
DeepSWE 1.158.7
SWE-bench Pro62.5
SWE-bench Multilingual81.0
NL2Repo48.1
LiveCodeBench v691.9
Toolathlon73.5

尤其是 SWE-bench Pro 62.5 和 LiveCodeBench 91.9,说明它不仅擅长生成代码,在真实软件工程任务中同样具备很强的竞争力。

但 DeepSeek-V4-Flash-Vision-Exp 也非常有意思。

DeepSeek 官方给出的 Agent/Coding 数据是:

BenchmarkDeepSeek V4 Vision
Terminal Bench 2.183.9
NL2Repo57.7
DeepSWE59.3
Toolathlon Verified75.9
DSBench-Hard63.6
AutomationBench25.7

单看这些数字,会发现 DeepSeek 在 Repo、Terminal、Tool Use 这类偏 Agentic Coding 的任务中非常强。

例如 DeepSWE:

  • Qwen:58.7
  • DeepSeek:59.3

Toolathlon:

  • Qwen:73.5
  • DeepSeek:75.9

NL2Repo:

  • Qwen:48.1
  • DeepSeek:57.7

需要注意,不同厂商公布的数据在 Agent Harness、Prompt 和执行环境上并不完全一致,因此不适合直接用 0.x 分判断胜负。

但至少可以得出一个比较明确的结论:

这两个模型的 Coding 能力已经处于同一个水平区间。

如果是传统代码生成、SWE-bench、跨语言软件工程,我会更倾向 Qwen。

如果是类似 Claude Code、Codex、OpenCode 这种:

读取项目
  ↓
搜索代码
  ↓
执行 Shell
  ↓
观察日志
  ↓
修改代码
  ↓
重新执行

的长流程 Coding Agent,DeepSeek V4 Vision 非常值得重视。

四、Agent:Qwen 更全面,DeepSeek 更偏工程

Qwen3.8-Flash-Next 一个非常明显的特点,就是它并没有只针对 Coding Agent 做优化。

它的 Agent Benchmark 覆盖范围相当广:

BenchmarkQwen3.8-Flash-Next
CoWorkBench73.9
JobBench55.7
Agents' Last Exam24.3 Pass@1
Toolathlon73.5

其中 CoWorkBench 涵盖计算机、金融、法律等长流程办公任务。

因此 Qwen 更适合:

  • 企业办公 Agent
  • 资料整理
  • 多工具协作
  • Web Agent
  • Coding Agent
  • Research Agent
  • 通用数字员工

而 DeepSeek 的优势方向更加集中:

  • Terminal
  • Shell
  • Repo
  • Coding
  • 工具调用
  • 自动化执行

这意味着,如果要构建服务器故障诊断 Agent:

收到告警
 ↓
SSH 登录服务器
 ↓
查看日志
 ↓
执行诊断命令
 ↓
分析结果
 ↓
继续调用工具
 ↓
形成修复方案

DeepSeek-V4-Flash-Vision-Exp 会是一个非常值得测试的模型。

而如果要构建一个企业内部“万能 Agent”,Qwen 的能力覆盖范围则更完整。

五、多模态:Qwen 更完整,DeepSeek 更高效

两者现在都已经不是纯文本模型。

但 Qwen 在多模态上的覆盖范围明显更广。

Qwen3.8-Flash-Next 原生支持:

Text
Image
Video

官方甚至直接给出了 Video Input 的 OpenAI API 调用方式。

其视觉 Agent 数据也相当突出:

BenchmarkQwen3.8-Flash-Next
ClawEval-MM64.4 Pass@3
AndroidWorld84.5
OSWorld 2.0 Partial52.3
Vision2Web64.0
LVBench76.6
RealWorldQA88.5
MathVision90.6

这些 Benchmark 已经明显超出了传统的“看图回答问题”,而是在测试:

看见界面 → 理解界面 → 操作应用。

所以如果未来要做 Computer Use,例如:

截图
 ↓
理解 UI
 ↓
判断按钮
 ↓
执行点击
 ↓
再次截图
 ↓
继续操作

Qwen3.8-Flash-Next 会更有吸引力。

DeepSeek-V4-Flash-Vision-Exp 的视觉能力则更强调 Agent、OCR、Chart 和 Screenshot。

其官方结果包括:

  • ApexBench:36.5
  • Agents' Last Exam:27.3
  • Chartography:64.3
  • ZeroBench:35.0

而且它有一个非常特别的优势:

每张图片最多大约只需要 387 个 Prompt Token。

这对 Screenshot Agent 很有意义。

比如一次给模型输入 20 张服务器监控截图、网页截图或者报表,并不会像一些传统 VLM 一样迅速消耗掉大量上下文。

所以可以简单理解为:

Qwen:多模态能力更全面。

DeepSeek:图片 Token 效率非常有吸引力。

六、长上下文:DeepSeek 是明显优势项

DeepSeek-V4-Flash-Vision-Exp:

1,048,576 Token 原生上下文。

Qwen3.8-Flash-Next:

262,144 Token 原生上下文。

Qwen 可以通过 YaRN 将上下文扩展至约 1M,但这属于 RoPE Scaling,而不是模型的原生长度。Qwen 官方也明确建议在将 YaRN 作为默认配置前,测试其对短上下文质量的影响。

因此如果场景是:

  • 巨型代码仓库
  • 大量技术文档
  • 长时间 Agent 历史
  • 大型 RAG Context
  • 数百份合同/报告
  • 超长日志

DeepSeek 的优势非常明显。

当然,“模型支持 1M”不等于“部署时应该直接把 KV Cache 配成 1M”。

vLLM 对 DeepSeek Vision 当前公开验证的 reference run 实际只使用了 32K max-model-len,官方也特别提醒 1M KV Cache 所需要的显存远高于模型权重本身。

七、推理效率:Qwen 的架构更加激进

如果只从每 Token 计算量看:

DeepSeek V4 Vision
13B Active Parameters

Qwen3.8 Flash Next
6B Active Parameters

Qwen 几乎只有一半。

但 Qwen 并没有简单缩小模型。

它增加了一个巨大的:

51B N-gram Embedding

作为类似长期 Lookup Memory 的结构。

这部分参数可以增加模型容量,却不需要像普通 Transformer 权重一样在每个 Token 上做大规模矩阵计算。

同时 Qwen 使用:

Gated DeltaNet
      ↓
压缩历史状态

Qwen Sparse Attention
      ↓
精确访问长距离 Token

N-gram Embedding
      ↓
提供大容量 Lookup Memory

MoE
      ↓
仅激活 6B

这其实比单纯追求“大参数模型”更值得关注。

Qwen3.8-Flash-Next 本质上是在尝试解决一个问题:

如何继续提高模型容量,但不要让推理成本同比增长?

从下一代大模型架构的发展方向来看,我认为这是 Qwen3.8-Flash-Next 最有价值的地方之一。

八、两者的思考模式也很不一样

DeepSeek V4 的 reasoning effort 分为:

low
high
max

并通过 chat_template_kwargs 控制。DeepSeek 官方评测使用的是 max

Qwen3.8-Flash-Next 则分为:

low
medium
xhigh

而且默认:

enable_thinking = true
reasoning_effort = xhigh
preserve_thinking = true

也就是说 Qwen 默认直接使用最高思考强度。

九、最终应该怎么选?

如果只能从两个模型中选择一个,我目前更倾向:

Qwen3.8-Flash-Next

原因不是它在 Coding 上碾压 DeepSeek——实际上两者 Coding 非常接近。

真正的原因是 Qwen 的能力覆盖面更完整:

强 Coding
+
强 Agent
+
图片
+
视频
+
Computer Use
+
262K Context
+
6B Active Parameters

第三方 Artificial Analysis 当前综合 Intelligence Index 也更偏向 Qwen。

但如果具体到以下场景:

大型 Repo / 超长文档

选:

DeepSeek-V4-Flash-Vision-Exp

Terminal / DevOps Agent

优先测试:

DeepSeek-V4-Flash-Vision-Exp

普通 Coding

两者都可以,略倾向:

Qwen3.8-Flash-Next

通用企业 Agent

选:

Qwen3.8-Flash-Next

Computer Use / UI Agent

选:

Qwen3.8-Flash-Next

视频理解

选:

Qwen3.8-Flash-Next

OCR / Chart / 大量 Screenshot

非常值得测试:

DeepSeek-V4-Flash-Vision-Exp

>256K 超长上下文

明显选择:

DeepSeek-V4-Flash-Vision-Exp