Lucent's Blog

Lucent's Blog

当时明月在 曾照彩云归


人生不相见,动如参与商。


GPT-6正式发布,人类进入AGI时代?

GPT-6正式发布,人类进入AGI时代?

万众期待的 GPT-6 Astra 和 GPT-6 Astra Pro ,正式发布!

GPT-6 发布会的最后,总裁 Greg Brockman 更是毫不掩饰地宣布:

Welcome to the AGI era.(欢迎来到AGI时代)

这一次发布,应该是 OpenAI 近年来规模最大的一次模型升级。

所以,OpenAI 这次确实完全没低调,训练规模、能力升级全部拉满,光预训练动用的GPU就超过10万块

GPT-6的价格也正式公布,API定价为:

  • 输入:10美元/百万token;
  • 输出:50美元/百万token

相当于GPT-5.6 Sol的2.5倍,跟刚刚发布的Fable 5.1持平,好刀法!

一、能力升级

咱们先不看纸面数据,先看看有哪些惊艳的 case。

1、硬件设计

这是一段经过压缩的 15 秒演示,展示了 GPT-6 Astra 如何在 KiCad 中完成印刷电路板(PCB)

AI 编程,大家已经逐渐习惯、适应之后,OpenAI 的大手终于还是伸向了硬件开发。

2、金融挑战赛

GPT-6 Astra 可以通过计算机操作完成 Financial Modeling World Cup(金融建模世界杯)的挑战任务,其速度约为获胜人类选手的 4 倍。这能够帮助分析师减少花在搭建模型上的时间,把更多精力投入到解读结果和制定决策上。

3、3D 建模

GPT-6 Astra 使用 Unity,将现有素材组装成一座城市的 3D 场景,让用户能够轻松创建一个符合自己设想、可供沉浸式探索的三维环境。

还可以沉浸式体验:

4、报税

GPT-6 Astra 可以读取 W-2 工资和税务表,并直接在浏览器中填写 Form 1040(美国个人所得税申报表),从而减少重复的数据录入工作,并生成一份可供审核的报税申报草稿。

这件事的价值并不只是“自动填表”。

美国个人报税本身就是一个相当繁琐的流程:纳税人往往需要收集 W-2、1099 等多种收入证明,再根据投资收益、房贷利息、医疗支出、子女、教育、兼职收入、抵扣和税收优惠等情况填写不同表格。

很多人还需要同时处理联邦税和州税,规则复杂、表格众多,而且填错可能带来补税、罚款或后续沟通成本。

复杂到什么程度?美国围绕“帮人报税”早就形成了一门成熟的生意。

大量个人会付费请注册会计师、税务代理或专业报税机构代办,提供软件和服务。换句话说,这原本就是一项很多人愿意花钱外包的专业工作。

而现在,这门生意,GPT-6 Astra 也能做了。

二、纸面数据

接着,我们看下纸面数据,看看 GP-6 有那些质的飞跃。

首先是 GPQA Diamond,研究生水平的物理化学生物题。

Astra拿了96%。上一代GPT-5.6 Sol是94.6%,Claude Fable 5.1是93.7%,Gemini 3.8 Flash是95.3%。

看到这我心想,行吧,大家都在95附近挤着,差不太多。

Terminal-Bench 4.0,考验在终端里干活的能力,得分57.9%。

Fable 5.1是55.8%,还是那句话,有点意思,但也就两个点。

AutomationBench,考验办公流程自动化能力,Astra 得分 41.4%,上一代Sol是18.1%,Fable 5.1是31.4%。

从18.1%到41.4%,这个提升还是很明显的。

为什么说,欢迎来到 AGI 呢?很大程度就是因为这个 ARC-AGI-3 能力测评。

ARC-AGI-3 是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。

这个分数意味着,面对从未见过、也没有现成解法的问题,Astra已经表现出很强的自主探索和规则学习能力。

当然 GPT-6 Astra 也不是全赢。

发布稿正文里放的那些图,你仔细看,全是它赢的项目。

这很正常,谁家发布稿不这么干。

但你把页面拉到最底下,那张大表要老实得多。

Artificial Analysis 的综合智能指数,Astra 61.2,Fable 5.1是 65.7,落后。

DeepSWE、FrontierCode这几个纯编程的榜,Astra跟Opus 5、跟Fable 5,来来回回就是零点几个点的差距,有的还略微落后。

所以我看有的人写「全方位无死角碾压Claude」,我是不太同意的。

不是说 Astra 不行,而是说它真正拉开差距的地方非常集中,就是 Terminal-Bench Science、AutomationBench、Agents' Last Exam、OSWorld 这类需要它自己操作电脑、自己跑完整流程的项目。

这些项目它是真的遥遥领先,而纯答题的项目,它跟第一梯队基本打平,个别还落后。

三、写在最后

最后小感慨两句,昨天觉得不可思议的能力,三个月后变成理所当然;  

去年还需要专门演示的功能,今年已经成了输入框旁边一个不起眼的按钮。

技术进步最奇怪的地方就在这里。

当变化足够快,人反而会失去对变化的感觉。

就像那只独角兽。

2023 年,我们盯着几根歪歪扭扭的 TikZ 线条,试图从里面辨认出智能的「火花」。

后来,它的腿越来越像腿,角越来越像角,身体有了光影,背景有了空间,直到有一天,我们甚至忘记了自己为什么还要盯着那只独角兽。

因为模型早已经不只是会画独角兽了。

它开始写程序,做研究,操作电脑,理解视频,调用工具,完成一个过去需要人类工作几个小时、几天,甚至几个星期的任务。

而我们对它的评价,依然可能只是:

“嗯,这一版确实比上一版好用不少。”

这可能就是 AGI 最反直觉的地方。

我们曾经想象它会像核爆一样出现:一个巨大的、不可忽视的历史时刻。

但它真正到来的方式,也许更像潮水。

海水每次只上涨一点点。

站在岸边的人几乎察觉不到。

直到你回头,才发现原来站着的那片沙滩,已经消失了。

所以,我越来越觉得,讨论 AGI 究竟在哪一天到来,也许没有那么重要。

真正重要的问题是:

当我们终于意识到它已经来了的时候,它究竟已经来了多久?

也许那条分界线并不在未来。

也许我们已经跨过去了。

只是跨过去的时候,没有人听见声音。