华为910B 通过 vllm 部署 Qwen3.5 系列模型
最近折腾了一阵华为昇腾 910B,目标很简单:在自己的机器上把 Qwen3.5 系列模型跑起来,而且最好还能兼容 OpenAI API、支持工具调用、支持超长上下文。 最后我选择了 vllm-ascend。 这一套下来,最大的感受是: * 能跑,而且跑得不算慢(至少在 Ascend上 不算慢) * 但坑也不少 * 很多问题不是模型的问题,而是镜像、驱动、卡型、参数组合的问题 下面放一个性能测试图: 一、环境说明 我这里的环境大概是这样: * 机器:华为