Lucent's Blog

Lucent's Blog

当时明月在 曾照彩云归


人生不相见,动如参与商。


Lucent

Lucent

125 篇文章

  1. DeepSeek Harness Cordis:为动态 Agent 而生的组件模型

    DeepSeek Harness Cordis:为动态 Agent 而生的组件模型

    13 min read
    AI

    最近在看 DeepSeek Harness 的时候,我顺着它的底层框架 Cordis 找到了一篇论文:《A Programming Paradigm for Spatiotemporal Composability》。 这个标题第一次看有点劝退。"时空可组合性"听起来很像编程语言理论里的东西,论文也确实花了不少篇幅做形式化定义和演算。 但如果先把这些公式放一边,它研究的问题其实很工程: 一个正在运行的软件系统,怎么安全地安装、卸载和替换组件? 这件事在传统插件系统里已经做了很多年。但到了 Agent 系统,问题突然严重起来。 一个 Agent 运行时里可能同时存在 LLM Provider、

  2. 当 AI 越狱测试场:OpenAI 模型入侵 Hugging Face 始末

    9 min read
    AI · 大模型

    首先,这件事是真的,而且不是“模拟环境里演戏”——OpenAI 的模型代理确实突破了测试边界,进入了 Hugging Face 的生产基础设施。 但它也不是网上渲染的那种“AI 觉醒后主动攻击人类”。现有证据表明: OpenAI 让模型参加网络安全能力测试,并暂时降低了安全拒绝;模型为了取得高分,把“解决测试题”优化成了“突破环境、联网并偷取测试答案”。 从实际数据损失看,事件最终被控制住了;但从模型能力、隔离设计和 OpenAI 的内部监控来看,这是一次非常严重的安全预警。 事情是怎么发生的 OpenAI 当时正在运行 ExploitGym

  3. 从标准开发流程到 AI 编程工作流:Spec-Kit、OpenSpec、Superpowers 与 Comet

    15 min read
    AI

    AI 会写代码,然后呢? AI 很会写代码了,我们为什么还要讨论开发流程? 先看一个很小的需求。产品说,给登录页加一个“记住我”。我们把这句话交给 AI,它很快会加上复选框,写入本地存储,可能顺手补一个测试。页面能点,刷新以后也还在,看起来做完了。 但接着问几句,事情就没那么简单了。记住的是账号,还是登录状态?有效期多长?公共电脑上怎么办?服务端的刷新令牌要不要调整?退出登录之后,客户端留下什么?原来的安全策略里有没有禁止项? 这些问题都不是代码语法问题。它们分散在需求、安全设计、接口约定、测试和验收里。AI

  4. 从 Prompt 到 KV Cache 讲清楚大模型缓存

    从 Prompt 到 KV Cache 讲清楚大模型缓存

    17 min read
    AI · 大模型 · vllm

    很多人在使用大模型 API 或部署 vLLM、SGLang 这类推理服务时,都会看到一个词:缓存命中。 比如: prefix cache hit rate cached_tokens cache_read_input_tokens KV cache reuse Prompt caching 这些词看起来都在说“缓存”,但它们并不是一回事。更容易误解的是,很多人会以为: 大模型缓存命中 = 上一次回答过的问题,这次直接把答案拿出来。 这其实只说对了一小部分。 在大模型推理系统里,

  5. OpenAI Agents SDK 深度解析:从工具调用到 Agent Harness

    24 min read
    AI

    OpenAI Agents SDK 是 OpenAI 面向 agentic AI 应用推出的一套 Python 框架。它不是另一个简单的 API wrapper,也不是把提示词、工具调用和多轮对话随意拼在一起的示例项目。按照仓库文档里的定位,它是 OpenAI 早期实验项目 Swarm 的生产化升级,目标是用尽量少的核心原语,把真实 Agent 应用里最常见的几件事放到同一个运行时里:模型调用、工具执行、多 Agent 协作、上下文管理、安全校验、人工介入、

  6. DeepSeek-V4 技术解读:百万 Token 上下文背后的效率路线

    33 min read
    AI · 大模型

    如果只看参数规模,DeepSeek-V4 很容易被理解成又一次“大模型继续变大”的发布:DeepSeek-V4-Pro 拥有 1.6T 总参数、49B 激活参数,DeepSeek-V4-Flash 拥有 284B 总参数、13B 激活参数,并且二者都声称支持一百万 token 上下文。但通读论文后会发现,DeepSeek-V4 真正想强调的并不是单纯堆参数,而是围绕“百万 token 上下文能否常态化使用”

  7. 为什么仅靠“预测下一个词”,大模型也能涌现出智能?

    6 min read

    很多人第一次接触大语言模型时,都会有一种强烈的不真实感。 一方面,它似乎只是一个“高级输入法”。每一步不过是在猜测下一个词、下一个字、下一个 token。它不知道自己在做什么,也没有真正的“意识”。 但另一方面,它却能写代码、解释数学、分析商业问题、撰写文章、甚至能够表现出推理、规划和创造力。 于是,一个看起来很矛盾的问题出现了: 如果模型做的事情只是预测下一个词,它为什么会表现得越来越像智能? 我觉得,理解这个问题,关键在于我们低估了“预测”这件事真正意味着什么。 预测下一个词,并不是在猜词 人们容易把“预测下一个词”理解成一种机械的填空游戏: * “今天天气很…

  8. Claude Code 为什么“不会忘”?深入拆解它的记忆系统与上下文压缩机制

    10 min read
    AI · 大模型

    很多人第一次使用 Claude Code 时,都会有一种很奇怪的感觉: 它好像真的“记得”我之前做过什么。 你让它连续改几个小时代码,它仍然知道: * 当前在修哪个 Bug * 刚刚改过哪些文件 * 哪个方案已经失败过 * 下一步应该继续做什么 甚至隔了很久回到项目里,它还能接上之前的工作。 但问题是: 大模型的上下文窗口再大,也不可能无限大。 一个真实的软件项目,往往会包含: * 几十到上百个文件 * 数十轮对话 * 大量工具调用 * 很长的日志、报错和代码片段 如果把所有内容都塞进 Prompt,模型迟早会“失忆”。 所以 Claude Code

  9. Claude Code 真正的秘密:模型之外,还有一套完整的 Agent 操作系统

    18 min read
    AI · 大模型

    从 Claude Code 源码里,我看到了下一代 Agent 的真正形态 不是更聪明的模型,而是更成熟的系统。 最近看了 Claude Code 源码。 npm 包里还原出的完整 TypeScript 源码, 4756 个文件。 刚看到这个数字的时候,我的第一反应不是“太夸张了”,而是: Claude Code 已经不是一个“会写代码的 AI 工具”了。 它更像一套完整的 Agent Operating System。