ANTHROPICOPENAI

Deep|LLM: GPT-6 Astra 打开 Coding 以外的新场景,Scaling Law 继续驱动算力需求

Andy·2026年9月8日

GPT-6 是 GPT-5 之后十三个月来第一个新的大版本号。这次换大版本号,OpenAI 给的理由是三个第一次:第一次在德州 Stargate 用 10 万块以上 GPU 做预训练,史上最大的一次训练;第一次让前代模型深度参与训练过程;第一次把 Computer Use 当成旗舰的核心能力来发布。9 月 3 日发布,目前已较全面开放,ChatGPT 付费用户、API、Azure 和 Bedrock 均已上线。价格为每百万 token 输入 10 美元、输出 50 美元,Sol 的 2.5 倍,和 Fable 5.1 一个价,上下文 1.05M。

我们的判断:Astra 是 knowledge work (泛白领工作)的 Claude 3.7时刻,潜在空间十倍于 Coding。​Claude 3.7 是去年 2 月出的,它代表的是 agent 第一次可用:Claude Code 作为研究预览随之推出,一个月后 Manus 出来,Operator、Deep Research 也都是那个季度的事,开发者第一次能把一个任务整个交出去,不用再一句一句提示。那时候的 agent 还很粗糙,会跑偏,需要人盯着。真正的爆发是九个月后的 Opus 4.5,可靠性上来了,Coding 从早期试用走向规模化采购,收入到了几百亿美元量级。Astra 的 Computer Use 现在还没到 Opus 4.5 当时在 Coding 上的可靠性,但趋势已经能看到了,而且这次对准的市场比 Coding 大一个量级。再往后看一层,Coding 和 knowledge work 的近期商业化主要从现有劳动支出切入,RSI 推动的 AI for Science 是新增产出,Astra 在数学和科研上的跃迁是通用模型参与科研的又一个重要信号。

从公开评测和演示看,Astra 在 Computer Use、空间和数学科研上明显强过 Fable 5.1,Coding 保持同一梯队,通用智力指数仍低于 Fable 5.1。背景上,Anthropic 预计 9 月底公开 S-1,Fable 5.1 是 IPO 前的版本,Astra 在约一周后发布。观点:

1、最大的亮点是 Computer Use,第二曲线十倍于 Coding

Computer Use 指的是模型直接操作人用的软件:看屏幕、点鼠标、敲键盘,直接在 Excel、CAD、Blender、浏览器里完成任务,省掉了写代码调 API 这一步。此前模型在直接操作复杂软件上一直有明显短板,挪一个 PPT 文本框要反复改代码,人拖一下鼠标就完成。Astra 把这只手长出来了:OSWorld 上一代提升 7 个点到 72.6%,单个任务的平均时长从 75 分钟压到 40 分钟;Agents' Last Exam 测的是在真实软件里做金融建模、工程、媒体制作这类专业任务,Astra 59.3%,Opus 5 是 55.5%,而且输出 token 少了 65%。

几个演示分别展示了不同环节的进展。专业软件操作:打开 KiCad,2 分 54 秒排完一块 PCB,这类任务此前仍需要大量人工操作。跨应用的办公流程:在 Power BI 里从原始数据做到看板,填一张 1040 税表,把一份法律文书按格式要求排好,一个人要花 5 小时的求职信息整理,它 2 分 51 秒做完。空间和创意软件:一张房子的照片重建成可编辑的 3D 内景,在 Blender 里建完模直接导进 Unreal 做成能走的场景,这是发布周传得最广的一类。带验证的完整流程:自己建网站然后跑前端 QA,自己装软件、测软件,做完还能自查结果。OpenAI 内部,它已经在公司代码库里承接原本要一个研究员做一周的实验,从想法到代码到跑完返回结果。

Continue reading with FUNDA

This report is available to subscribers. Sign in or subscribe to read the full analysis.