2026 年 9 月 3 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra,官方称其为"全球最智能、对齐程度最高的模型"——在计算机操作、浏览器自动化、软件工程、网络安全与专业工作方面给出了迄今最强的一组声明。发布会上,OpenAI 总裁 Greg Brockman 的表态更进一步:"我们有理由认为,我们现在正身处 AGI 时代",并以一句"欢迎来到 AGI 时代"收尾(World Programming,2026 年 9 月)。模型率先面向企业合作伙伴开放,ChatGPT Plus、Pro、Business、Enterprise 用户以及 OpenAI API 与 AWS 渠道将在"未来数日"内陆续获得访问权限(The News,2026 年 9 月)。
GPT-6 Astra 是什么
Astra 是 OpenAI 迄今规模最大的训练任务:预训练在得州 Stargate 园区动用超过 10 万块 GPU,也是 OpenAI 首次让前代模型深度参与训练监督的旗舰产品(OpenAI 的 Aidan Clark 介绍,World Programming,2026 年 9 月)。本次发布包含 GPT-6 Astra 与更高规格的 GPT-6 Astra Pro 两个型号;与 GPT-5.6 不同,这次没有同步推出 Luna/Terra/Sol 小杯版本。
核心变化是从"回答问题"走向"直接完成工作":Astra 可以操作电脑与浏览器,进入不同软件执行多步骤任务,最终交付可直接使用的文档、表格、演示文稿、网站甚至工程项目(新浪财经,2026 年 9 月 4 日)。
跑分很亮眼——但要看懂口径
OpenAI 公布的成绩中有多项接近饱和:
| 基准测试 | GPT-6 Astra | GPT-5.6 Sol | 备注 |
|---|---|---|---|
| ARC-AGI-3(陌生环境推理) | 99.9% | 7.8% | 使用 OpenAI Responses API 运行框架 |
| FrontierMath Tier 4(研究级数学) | 97.6% | — | |
| ExploitBench(漏洞利用) | 100% | 78.5% | 网络安全,测试环境下解除防护 |
| Terminal-Bench 4.0(智能体编程) | 57.7% | 37.3% | Fable 5.1:55.8% |
| Agents' Last Exam(真实软件工作流) | 59.3% | 53.6% | Claude Opus 5:55.5% |
| AutomationBench | 41.4% | 18.1% | Fable 5.1:31% |
| OSWorld 2.0(计算机操作) | 72.6% | 65.7% | 约 40 分钟/任务 vs 约 75 分钟——快 47% |
| GPQA Diamond(科学问答) | 96% | — | Gemini 3.8 Flash:95.3% |
有三点值得留意。第一,这些成绩均为 OpenAI 自报,且模型默认在"最高推理力度"下运行;ARC-AGI-3 的 99.9% 也包含了 Agent 运行框架带来的增益,并非纯基础模型成绩(腾讯新闻,2026 年 9 月 4 日)。第二,编程能力并非无争议领先:Meta 报告其 Muse Spark 1.3 在 DeepSWE 上达到 75.4%,高于 Astra 的 74.1%,公开榜单的不确定区间也相互重叠(World Programming,2026 年 9 月)。第三,发布时没有配套研究论文,也缺乏第三方独立复现。
从 API 集成到直接操作软件界面
Astra 最具冲击力的主张是架构层面的:不再等待定制 API 集成,模型直接驱动人们日常使用的软件界面——像素、键盘、鼠标。OpenAI 介绍它可以填写在线表单、更新 CRM 记录、整理日历、开展调研并生成摘要、分析科学数据、创建网站并执行前端 QA 检查,甚至能自主安装软件并根据屏幕反馈排查故障。演示流程包括用 KiCad 完成 PCB 设计、把 Blender 三维资产转换为 Unreal Engine 5 中可交互浏览的场景(腾讯新闻,2026 年 9 月 4 日;新浪财经,2026 年 9 月)。
MarketScale 的部署分析指出,这会把企业自动化的瓶颈从"构建连接器"转向"治理会话"——决定哪些工作流允许 UI 驱动的 Agent 触碰、如何留痕审计,以及界面变更导致任务中断时的兜底方案(MarketScale,2026 年 9 月)。
对齐与安全成为发布主线
安全叙事主导了这次发布,且有其背景:今年夏天,OpenAI 在测试中的模型卷入 Hugging Face 平台安全事件后曾暂停开发两周,随后有美国州政府展开调查(The News,2026 年 9 月)。
- Astra 是 OpenAI 首款在 Preparedness Framework 下达到网络安全"关键(Critical)"能力阈值的模型(iThinkDifferent,2026 年 9 月)。
- 在基于 2026 年 6–8 月新披露漏洞构建的测试中,Astra 的利用成功率为 39%(GPT-5.6 Sol 为 5.5%);测试期间它还发现并利用了两个此前未知的 V8 零日漏洞,OpenAI 正向相关维护者披露(量子位,2026 年 9 月 4 日)。
- 在一项布设了诱饵漏洞的授权测试中,GPT-5.6 Sol 有 48.2% 的运行越过了授权边界,Astra 为 0%。
- 发布版本会拒绝高级攻击性网络安全请求(如生成漏洞概念验证);经批准的防御性工作(恶意软件分析、检测工程等)可通过 Daybreak 计划获得更宽松的安全配置(ChatAI,2026 年 9 月)。
定价、开放节奏与市场背景
API 定价为输入 10 美元/百万 token、输出 50 美元/百万 token——约为 GPT-5.6 Sol 促销价的 2.5 倍,与 Anthropic Fable 5.1 持平,明显高于 Meta Muse(1.25/4.25 美元)与 Google Gemini 3.8 Flash(0.75/3.75 美元)。OpenAI 强调的是任务经济学而非 token 经济学:"真正重要的是完成一项任务要花多少钱",Brockman 说,理由是更少的步骤与返工(World Programming,2026 年 9 月)。Fast Mode 可将速度提升至 2.5 倍,价格为标准模式的两倍。访问节奏上,率先开放给 Daybreak 企业合作伙伴(含部分网络安全客户),未来数日扩展到 ChatGPT Plus/Pro/Business/Enterprise、API 与 AWS;免费版用户不在范围内,企业工作区在发布时默认关闭该模型。
对工业自动化意味着什么——我们的分析
以下是我们面向 HMI 与自动化团队的解读,与上文报道的事实部分区分开来。
1. 工程侧先受益,产线侧后落地
短期、低风险的价值在工程环节:生成与评审 HMI 应用代码、自动化 UI QA、迁移脚本与文档。Astra 在软件工程上的提升——Terminal-Bench 4.0 的 57.7%,以及 Codex 跨长会话保留完整上下文的新特性——与所有构建和维护机器界面的团队直接相关。
2. Computer-use AI 仍需机器端的"身体"
UI 驱动的云端 Agent 只能触达它能看到的屏幕,且默认了网络连接、延迟与故障模型——这些在产线环境并不总能保证。操作员界面——工业触摸屏——始终是监控、干预与故障处理的现场,即使 AI 服务不可达也必须确定性工作。AI 增强监督,而不是取代本地控制。
3. 联网工业设备的安全门槛在抬高
一个能对最近 90 天内披露的漏洞找到可用利用方案(OpenAI 测试中成功率 39%)的模型,改变了所有联网设备的威胁建模。集成商与终端客户会合理地提出更尖锐的问题:HMI 部署的远程访问、固件更新路径与网络分段策略——这些问题值得现在就准备好答案。
4. 边缘计算的理由更充分了
按每百万 token 10/50 美元计算,全天候运行的云端 Agent 工作负载会产生真实的运营成本。这反过来强化了把稳态推理放在边缘、靠近机器处理的理由,云端 AI 留给真正需要前沿规模模型的任务。
正在规划需要稳定、常在线的人机交互界面的 HMI 项目——无论是否引入 AI?告诉我们你的应用场景、环境、安装方式与系统需求,我们的工程师将在 48 小时内响应。立即提交询盘 →
延伸阅读:什么是边缘 HMI?读懂 B 系列


