DeepSeek-V4-Flash-Vision-Exp vs Qwen3.8-Flash-Next:新一代开源模型该怎么选?
2026 年下半年,开源大模型又迎来了一轮明显的架构升级。
DeepSeek 推出了首个 V4 多模态实验模型 DeepSeek-V4-Flash-Vision-Exp,Qwen 则发布了带有下一代 Qwen4 架构预览性质的 Qwen3.8-Flash-Next。
这两个模型有不少相似之处:都是 MoE、都支持思考、都支持视觉输入、都面向 Coding 与 Agent 场景,而且都可以通过 vLLM 私有化部署。
但真正深入使用后会发现,它们其实走了两条很不一样的路线。
一句话概括:
Qwen3.8-Flash-Next 更像一个追求综合能力与推理效率的“通用 Agent 模型”;DeepSeek-V4-Flash-Vision-Exp 则更像一个面向 Coding、工具调用和超长上下文的“工程型模型”。
截至 2026 年 9 月,第三方 Artificial Analysis 的综合 Intelligence Index 给 Qwen3.8-Flash-Next 56 分、DeepSeek-V4-Flash-Vision-Exp 51 分。不过在输出速度和上下文长度上,DeepSeek 又明显占优。
一、先看基本规格
| 项目 | DeepSeek-V4-Flash-Vision-Exp | Qwen3.8-Flash-Next |
|---|---|---|
| 架构 | MoE | MoE |
| 总体规模 | 约 285B | 125B 主模型 + 51B N-gram Embedding |
| 每 Token 激活参数 | 13B | 6B |
| 原生上下文 | 1,048,576 | 262,144 |
| 图像输入 | 支持 | 支持 |
| 视频输入 | — | 支持 |
| Thinking | 支持 | 支持 |
| Tool Calling | 支持 | 支持 |
| DeepSeek/Qwen 特有结构 | CSA、Hyper-Connections、DSpark | GDN、QSA、N-gram Embedding、MTP |
| License | MIT | Qwen Community License 1.0 |
DeepSeek V4 Vision 基于约 285B/13B Active 的 V4 MoE 主干,包含 256 个 routed experts,每个 Token 激活其中 6 个,同时加入 32 层视觉编码器,并原生提供 1,048,576 Token 上下文。
Qwen3.8-Flash-Next 则采用了更加激进的稀疏设计:125B 主模型之外,再增加约 51B 的 N-gram Embedding,但推理时每个 Token 只激活约 6B 参数。其核心架构由 Gated DeltaNet、Qwen Sparse Attention、N-gram Embedding 和 MTP 组成。
仅从架构来看,Qwen 的方向非常明确:
尽可能增加模型容量,但不要让这些容量全部变成每个 Token 的计算量。
而 DeepSeek 的思路则更倾向于:
保持更大的有效模型容量,同时围绕 Attention、MoE、Speculative Decoding 和长上下文继续优化。
二、综合能力:Qwen 当前略占优势
目前最容易直接横向观察的数据来自 Artificial Analysis。
在相同的高强度 Reasoning 对比下:
| 指标 | Qwen3.8-Flash-Next | DeepSeek V4 Vision |
|---|---|---|
| Intelligence Index | 56 | 51 |
| 输出速度 | 约 69~76 tok/s | 约 120 tok/s |
| TTFT | 2.74 秒 | 约 1.08 秒 |
| Context | 256K | 1M |
所以如果只看综合 Benchmark:
Qwen 当前领先。
但值得注意的是,这并不是一个“Qwen 全面胜出”的结果。
DeepSeek 的响应速度和首 Token 延迟反而明显更低,而且拥有四倍左右的原生上下文长度。
另外,这里的速度来自第三方托管 API,受到硬件、Batch、量化方式、Provider 调度等因素影响。
三、Coding:两者差距其实非常小
对于这两个模型,Coding 是最值得关注的部分。
Qwen3.8-Flash-Next 官方公布的数据相当漂亮:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| DeepSWE 1.1 | 58.7 |
| SWE-bench Pro | 62.5 |
| SWE-bench Multilingual | 81.0 |
| NL2Repo | 48.1 |
| LiveCodeBench v6 | 91.9 |
| Toolathlon | 73.5 |
尤其是 SWE-bench Pro 62.5 和 LiveCodeBench 91.9,说明它不仅擅长生成代码,在真实软件工程任务中同样具备很强的竞争力。
但 DeepSeek-V4-Flash-Vision-Exp 也非常有意思。
DeepSeek 官方给出的 Agent/Coding 数据是:
| Benchmark | DeepSeek V4 Vision |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| Toolathlon Verified | 75.9 |
| DSBench-Hard | 63.6 |
| AutomationBench | 25.7 |
单看这些数字,会发现 DeepSeek 在 Repo、Terminal、Tool Use 这类偏 Agentic Coding 的任务中非常强。
例如 DeepSWE:
- Qwen:58.7
- DeepSeek:59.3
Toolathlon:
- Qwen:73.5
- DeepSeek:75.9
NL2Repo:
- Qwen:48.1
- DeepSeek:57.7
需要注意,不同厂商公布的数据在 Agent Harness、Prompt 和执行环境上并不完全一致,因此不适合直接用 0.x 分判断胜负。
但至少可以得出一个比较明确的结论:
这两个模型的 Coding 能力已经处于同一个水平区间。
如果是传统代码生成、SWE-bench、跨语言软件工程,我会更倾向 Qwen。
如果是类似 Claude Code、Codex、OpenCode 这种:
读取项目
↓
搜索代码
↓
执行 Shell
↓
观察日志
↓
修改代码
↓
重新执行
的长流程 Coding Agent,DeepSeek V4 Vision 非常值得重视。
四、Agent:Qwen 更全面,DeepSeek 更偏工程
Qwen3.8-Flash-Next 一个非常明显的特点,就是它并没有只针对 Coding Agent 做优化。
它的 Agent Benchmark 覆盖范围相当广:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| CoWorkBench | 73.9 |
| JobBench | 55.7 |
| Agents' Last Exam | 24.3 Pass@1 |
| Toolathlon | 73.5 |
其中 CoWorkBench 涵盖计算机、金融、法律等长流程办公任务。
因此 Qwen 更适合:
- 企业办公 Agent
- 资料整理
- 多工具协作
- Web Agent
- Coding Agent
- Research Agent
- 通用数字员工
而 DeepSeek 的优势方向更加集中:
- Terminal
- Shell
- Repo
- Coding
- 工具调用
- 自动化执行
这意味着,如果要构建服务器故障诊断 Agent:
收到告警
↓
SSH 登录服务器
↓
查看日志
↓
执行诊断命令
↓
分析结果
↓
继续调用工具
↓
形成修复方案
DeepSeek-V4-Flash-Vision-Exp 会是一个非常值得测试的模型。
而如果要构建一个企业内部“万能 Agent”,Qwen 的能力覆盖范围则更完整。
五、多模态:Qwen 更完整,DeepSeek 更高效
两者现在都已经不是纯文本模型。
但 Qwen 在多模态上的覆盖范围明显更广。
Qwen3.8-Flash-Next 原生支持:
Text
Image
Video
官方甚至直接给出了 Video Input 的 OpenAI API 调用方式。
其视觉 Agent 数据也相当突出:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| ClawEval-MM | 64.4 Pass@3 |
| AndroidWorld | 84.5 |
| OSWorld 2.0 Partial | 52.3 |
| Vision2Web | 64.0 |
| LVBench | 76.6 |
| RealWorldQA | 88.5 |
| MathVision | 90.6 |
这些 Benchmark 已经明显超出了传统的“看图回答问题”,而是在测试:
看见界面 → 理解界面 → 操作应用。
所以如果未来要做 Computer Use,例如:
截图
↓
理解 UI
↓
判断按钮
↓
执行点击
↓
再次截图
↓
继续操作
Qwen3.8-Flash-Next 会更有吸引力。
DeepSeek-V4-Flash-Vision-Exp 的视觉能力则更强调 Agent、OCR、Chart 和 Screenshot。
其官方结果包括:
- ApexBench:36.5
- Agents' Last Exam:27.3
- Chartography:64.3
- ZeroBench:35.0
而且它有一个非常特别的优势:
每张图片最多大约只需要 387 个 Prompt Token。
这对 Screenshot Agent 很有意义。
比如一次给模型输入 20 张服务器监控截图、网页截图或者报表,并不会像一些传统 VLM 一样迅速消耗掉大量上下文。
所以可以简单理解为:
Qwen:多模态能力更全面。
DeepSeek:图片 Token 效率非常有吸引力。
六、长上下文:DeepSeek 是明显优势项
DeepSeek-V4-Flash-Vision-Exp:
1,048,576 Token 原生上下文。
Qwen3.8-Flash-Next:
262,144 Token 原生上下文。
Qwen 可以通过 YaRN 将上下文扩展至约 1M,但这属于 RoPE Scaling,而不是模型的原生长度。Qwen 官方也明确建议在将 YaRN 作为默认配置前,测试其对短上下文质量的影响。
因此如果场景是:
- 巨型代码仓库
- 大量技术文档
- 长时间 Agent 历史
- 大型 RAG Context
- 数百份合同/报告
- 超长日志
DeepSeek 的优势非常明显。
当然,“模型支持 1M”不等于“部署时应该直接把 KV Cache 配成 1M”。
vLLM 对 DeepSeek Vision 当前公开验证的 reference run 实际只使用了 32K max-model-len,官方也特别提醒 1M KV Cache 所需要的显存远高于模型权重本身。
七、推理效率:Qwen 的架构更加激进
如果只从每 Token 计算量看:
DeepSeek V4 Vision
13B Active Parameters
Qwen3.8 Flash Next
6B Active Parameters
Qwen 几乎只有一半。
但 Qwen 并没有简单缩小模型。
它增加了一个巨大的:
51B N-gram Embedding
作为类似长期 Lookup Memory 的结构。
这部分参数可以增加模型容量,却不需要像普通 Transformer 权重一样在每个 Token 上做大规模矩阵计算。
同时 Qwen 使用:
Gated DeltaNet
↓
压缩历史状态
Qwen Sparse Attention
↓
精确访问长距离 Token
N-gram Embedding
↓
提供大容量 Lookup Memory
MoE
↓
仅激活 6B
这其实比单纯追求“大参数模型”更值得关注。
Qwen3.8-Flash-Next 本质上是在尝试解决一个问题:
如何继续提高模型容量,但不要让推理成本同比增长?
从下一代大模型架构的发展方向来看,我认为这是 Qwen3.8-Flash-Next 最有价值的地方之一。
八、两者的思考模式也很不一样
DeepSeek V4 的 reasoning effort 分为:
low
high
max
并通过 chat_template_kwargs 控制。DeepSeek 官方评测使用的是 max。
Qwen3.8-Flash-Next 则分为:
low
medium
xhigh
而且默认:
enable_thinking = true
reasoning_effort = xhigh
preserve_thinking = true
也就是说 Qwen 默认直接使用最高思考强度。
九、最终应该怎么选?
如果只能从两个模型中选择一个,我目前更倾向:
Qwen3.8-Flash-Next
原因不是它在 Coding 上碾压 DeepSeek——实际上两者 Coding 非常接近。
真正的原因是 Qwen 的能力覆盖面更完整:
强 Coding
+
强 Agent
+
图片
+
视频
+
Computer Use
+
262K Context
+
6B Active Parameters
第三方 Artificial Analysis 当前综合 Intelligence Index 也更偏向 Qwen。
但如果具体到以下场景:
大型 Repo / 超长文档
选:
DeepSeek-V4-Flash-Vision-Exp
Terminal / DevOps Agent
优先测试:
DeepSeek-V4-Flash-Vision-Exp
普通 Coding
两者都可以,略倾向:
Qwen3.8-Flash-Next
通用企业 Agent
选:
Qwen3.8-Flash-Next
Computer Use / UI Agent
选:
Qwen3.8-Flash-Next
视频理解
选:
Qwen3.8-Flash-Next
OCR / Chart / 大量 Screenshot
非常值得测试:
DeepSeek-V4-Flash-Vision-Exp
>256K 超长上下文
明显选择:
DeepSeek-V4-Flash-Vision-Exp
评论暂时无法加载。