双机 16×H100 部署 DeepSeek-V4.1-Flash:vLLM DP2 × TP8 + EP16 + 1M 上下文实战
DeepSeek-V4.1-Flash 是 DeepSeek 新一代大规模 MoE 模型,原生支持 1,048,576 Token(1M)上下文,同时包含 Engram Memory、稀疏注意力、Vision 以及 DSpark Speculative Decoding 等机制。 vLLM 官方 Recipe 给出的模型规模非常大:约 552B Backbone + 196B