从 Prompt 到 KV Cache 讲清楚大模型缓存
很多人在使用大模型 API 或部署 vLLM、SGLang 这类推理服务时,都会看到一个词:缓存命中。 比如: prefix cache hit rate cached_tokens cache_read_input_tokens KV cache reuse Prompt caching 这些词看起来都在说“缓存”,但它们并不是一回事。更容易误解的是,很多人会以为: 大模型缓存命中 = 上一次回答过的问题,这次直接把答案拿出来。 这其实只说对了一小部分。 在大模型推理系统里,