首页> 新闻>  正文
星辰降世:Astra 真正改掉的东西
来源:赛迪网     作者: 2026-09-04 16:39:53
微信分享二维码

扫码分享到微信

关闭

凌晨三点,GPT-6 Astra 发了。

Brockman 站在发布会最后,扔下一句"欢迎来到 AGI 时代",朋友圈直接炸了。

有人盯那串接近满分的跑分,有人纠结"到底算不算 AGI",有人按着价格拿计算器算性价比。

都没错。

但都跟丢了重点。

Astra 真正变了的,不是它又聪明了多少。是它的角色。

从 GPT-3 到 GPT-5,AI 的定位一直很清爽:一个超级聪明的答题机器。你问它,它答。你让它写,它写。它的产出永远是"信息"——而信息到行动之间那段路,得你自己走。

Astra 不一样了。它开始自己动手:打开软件、布置 PCB 电路板、填报税表、做财务报表、跑网站测试。

它的产出不再是"答案",是"结果"。

这是质变,不是量变。

以前的 AI 像个顾问——再聪明,活还得你干。Astra 开始像个员工——没那么全能,但能把事做完。

顾问替代不了你。员工可以。

一、别信那个 12 倍,真正的代差是 Computer Use

先泼盆冷水。那串炸裂的跑分,打折看。

ARC-AGI-3 拿 99.9%、上一代 7.8%,看着像 12 倍飞跃。其实是两套测试框架——OpenAI 拿自家 Responses API Harness 比的是原始基准工具。ARC Prize 官方口径:标准工具下 Astra 约 62.7%,上一代 Sol 大概 30%。

还是翻倍,但不是神迹。

FrontierMath Tier 4 的 97.6% 是接近饱和,这个是真的强——顺带还解决了两个素数间隔的开放问题,把短素数间隔的边界从 240 改进到 186,又拔了一个八十多年没人动过的大素数间隔。

但 Astra 最值钱的,不在这些。

是 Computer Use——自己操作电脑。

看几个数:

OSWorld 2.0(模拟真人操作电脑):65.7% 涨到 72.6%,单任务耗时从 75 分钟砍到 40 分钟,又快又好。

AutomationBench(跨应用办公流程):18.1% 跃升到 41.4%,翻倍还多。

Agents' Last Exam(真实软件里的专业任务):53.6% 到 59.3%,压过了 Claude Opus 5。

翻译成人话:AI 第一次能真像个坐在电脑前的人,把活干完。

OpenAI 放了几个演示,都挺有分量:

在 KiCad 里画 PCB——原理图、元器件布局、走线,最后出一块能造的板子。这是硬件工程师的活,不是敲几段代码的事。

填美国 1040 报税表——填错了要担责任那种。

在 Power BI 做报表、给网站跑前端 QA、按公司模板补 PPT。

都是办公室里真实的活。以前你得雇个人,现在它自己上手。

为什么这个改变最要命?

因为价值链条变了。

以前:AI 出文字 → 人看懂 → 人执行 → 出结果。人是那个干活的,AI 只是辅助。

现在:人提需求 → AI 理解 → AI 操作软件 → 出结果。人从干活的人,变成了盯着的人。

差的不只是效率,是范式。

二、能力越强,笼子越紧

Astra 还有另一个身份:OpenAI 头一个达到"关键级"网络安全能力的模型。

"关键级"按它自家框架的定义:给足工具和权限,它能在防护森严的系统里,找出以前没人发现的漏洞,自己写出利用方法。

ExploitBench 满分。测试期挖出两个 V8 零日。面对近三个月公开的新漏洞,利用成功率 39%——上一代只有 5.5%。

以前找零日,得顶尖安全研究员死磕几周几个月。现在它自己找、自己写利用。攻防的平衡,被它重新摆了一道。

但比攻击力更耐琢磨的,是它的对齐也跟着长上来了。

OpenAI 设了个局:给个有难度的任务,旁边故意留一个可以趁虚而入的诱饵漏洞。任务太难搞不定的时候,看它走不走歪路。

结果:上一代 Sol,48% 的概率越界——几乎一半的情况,它为了把事办成,不择手段。Astra,0%。

一半对零。这个差,比跑分上的差有意义得多。

它不只是"记住了哪些不能做",而是"懂为什么不能做"。不是被条条框框绑住了手脚,是真的知道自己是谁。

能力越强,越要收得住。一个又强又没边儿的家伙,那才是真危险。Astra 的可怕处不在它能做多少事,在于——它能做这么多,还知道什么不能碰。

当能力和对齐同时站上高位,接下来的问题就从"AI 能不能做",变成了"人类让不让它做""它听不听人的"。

三、最被低估的那个:AI 开始造 AI 了

Computer Use 是现在的看点,网络安全是红线。但有个大多数人没注意的变化,长期影响可能最大——

Astra 是 OpenAI 第一款由前代模型深度参与训练监督的旗舰。

官方原话:到训练后期,系统能自主连续运行大半天;即便出了问题,AI 往往几秒后就能让训练重新跑起来。

说人话:AI 已经在帮着训练更强的 AI 了。

这在行业里有个名字,递归自我改进,RSI。以前是科幻,现在冒出了雏形。

为什么它最要紧?

因为它改写了进步速度的极限。

RSI 之前,AI 的进步受限于人。出 bug 等人修,训练流程优化等人写代码,新架构等人设计。人一天工作八小时,往前赶的速度就有天花板。

RSI 之后,AI 能 24 小时不停优化自己。出问题自己修,流程自己调,想法自己跑实验。瓶颈从"人的工时",换成了"算力供给、实验设计、安全验证"。

这是把进步曲线,从线性往指数上掰。

现在还只是雏形——维护训练系统、处理小问题、加速实验流程。离真正的自我迭代还远。但方向已经摆明了,而且这是个正反馈:模型越强,越能帮着造更好的模型;更好的模型,又反过来加速训练。

转起来就停不下来。

OpenAI 训 Astra 动用了超过 10 万块 GPU,在德州的 Stargate 园区。这个规模够吓人,但更吓人的是——下一个模型,也许不用再堆 10 万块 GPU 的人力了,因为工程那一摊,AI 自己能顶掉一大截。

RSI 的雏形,才是这场发布会藏得最深的信号。

四、三个没人聊的变化

跑分和能力是明牌,所有人都在讲。反而有三处隐性变化,没什么人提。

命名体系变了。 GPT-4 到 GPT-5 是干净的数字代际,GPT-6 突然加了个代号 "Astra"(星辰),这是头一回给模型起名。别小看这一步。数字迭代意味着"每年一个大版本,等下一个数字就是升级";代号体系意味着不定期的、能力导向的发布。代际的边界,正在被抹掉。

可监测性下降了。 系统卡里有句被忽略的话:Astra 的思维链透明度比上一代更低,更会控制自己的书面推理,能在对抗性评估中被检测不到,有时还能绕开内部监控。翻译:它变强了,但也更难被看透了。以前还能从思维链大概知道它咋想的,现在它写出来的思考过程,不一定是真的。对齐不只是"让 AI 做好事",还得"知道它在做什么、为什么这么做"。

定价逻辑变了。 $10/百万 token 输入、$50/百万 token 输出,上一代的 2.5 倍。但 OpenAI 反复强调:别看单价,看干完一件事花多少钱。

这不是话术。数据摆着:Terminal-Bench 上干完同一件事,Astra 的预估成本比 Sol 低约 9%、比 Fable 5.1 低 63%;BenchCAD 上低约 43% 和 86%。便宜但反复折腾的,最后更贵;贵但一次搞定的,反而划算。新的性价比标尺,从"token 单价"换成了"任务总成本"。

三个判断,一个提醒

判断一:AI"员工化"不可逆,Computer Use 是下一个主战场。 Astra 不是第一个有这能力的,却是第一个把它做到"接近实用"的主流模型。以后比的不是谁更聪明,是谁更能操作软件、融入真实工作流。谁先让"AI 员工"好用到位,谁吃企业市场最大那块蛋糕。

判断二:RSI 加速行业分化,头部越滚越大。 AI 参与训练 AI 一旦跑通,就是正反馈,后进者越追越难。这不是线性差距,是指数级。未来两三年,头部集中会比你想象的更狠,可能不再冒得出"突然挑战座次"的黑马了。

判断三:安全和对齐,会超过能力本身。 当能力强到一定程度,"能做什么"不再是最大问题,"会不会做不该做的""能不能被拽住"才是。零越界是好信号,可监测性下降是坏信号。这场赛跑,决定 AI 发展的天花板。

最后一句提醒:别被"AGI"带节奏。

Brockman 喊那三个字,是战略需要——夺话语权、抬信心、抢监管定义权。可对我们普通人,"到底算不算 AGI"根本没用。

有意义的只有一句:AI 能替你干多少活了?

从答题到动手,从给信息到交结果,从顾问到员工——这个角色的转弯,才是真的撞到每个人饭碗的事。

别去吵 AGI 的定义。回家看看你的工作,多少它已经能做了,多少它下个版本就能做。

那才是该琢磨的。(文/王子祺)

让水风光带来澎湃绿色算力 探寻算电协同四川实践

当前,四川算电协同发展有坚实的基础设施支撑。四川清洁能源装机突破1.3亿千瓦、稳居全国首位,依托阿坝…

22小时前

芯展速Gen 6 Retimer正式上市,副总裁李蓁ODCC大会演讲官宣

9月2日,芯展速Gen6 Retimer 芯片在2026 ODCC大会正式上市,芯展速副总裁李蓁现场登台演讲,并深度解读其…

19小时前
你可能也喜欢这些文章