Lucent's Blog

Lucent's Blog

当时明月在 曾照彩云归


人生不相见,动如参与商。


vllm

  1. 从 Prompt 到 KV Cache 讲清楚大模型缓存

    从 Prompt 到 KV Cache 讲清楚大模型缓存

    17 min read
    AI · 大模型 · vllm

    很多人在使用大模型 API 或部署 vLLM、SGLang 这类推理服务时,都会看到一个词:缓存命中。 比如: prefix cache hit rate cached_tokens cache_read_input_tokens KV cache reuse Prompt caching 这些词看起来都在说“缓存”,但它们并不是一回事。更容易误解的是,很多人会以为: 大模型缓存命中 = 上一次回答过的问题,这次直接把答案拿出来。 这其实只说对了一小部分。 在大模型推理系统里,

  2. 华为910B 通过 vllm 部署 Qwen3.5 系列模型

    8 min read
    AI · 大模型 · vllm

    最近折腾了一阵华为昇腾 910B,目标很简单:在自己的机器上把 Qwen3.5 系列模型跑起来,而且最好还能兼容 OpenAI API、支持工具调用、支持超长上下文。 最后我选择了 vllm-ascend。 这一套下来,最大的感受是: * 能跑,而且跑得不算慢(至少在 Ascend上 不算慢) * 但坑也不少 * 很多问题不是模型的问题,而是镜像、驱动、卡型、参数组合的问题 下面放一个性能测试图: 一、环境说明 我这里的环境大概是这样: * 机器:华为