OpenAI 正式推出新一代旗舰模型 GPT-6 Astra,这款被定义为“全球最智能且对齐程度最高”的模型,标志着人工智能发展进入全新阶段。联合创始人格雷格・布罗克曼在发布会上宣称“欢迎来到 AGI 时代”,这一论断并非营销噱头——经过三天的实际使用,Astra 展现出的能力远超以往版本,它不再局限于被动回答问题,而是能够主动操作电脑、独立完成复杂工作流,真正成为具备自主执行能力的数字员工。
在计算机操作领域,Astra 的突破尤为显著。传统模型使用时,用户需将复杂任务拆解为多个步骤,逐一输入指令并确认执行结果;而 Astra 可直接接管电脑和浏览器,从打开软件、搜索资料、编辑文件到最终交付成果,全程无需人工干预。官方演示中,它完成了填写在线表单、更新客户关系管理系统数据、整理日程安排、开展网络研究并在邮件和文档中生成内容等任务,甚至具备分析科学数据、生成可视化图表、创建网站并自动运行前端质量测试的能力。
性能对比数据进一步印证了这一代际跃迁。在 OSWorld 2.0 计算机操作测试中,Astra 得分 72.6%,较 GPT-5.6 Sol 的 65.7% 提升明显;更关键的是效率指标——Astra 平均完成每项任务耗时约 40 分钟,而前代模型需 75 分钟,效率提升近 47%。在模拟真实工作场景的 Agents' Last Exam 测试中,Astra 以 59.3% 的得分超越 GPT-5.6 Sol(53.6%)和 Claude Opus 5(55.5%),该测试要求模型在真实电脑环境中同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并以最终交付物质量评分。
软件工程领域是 Astra 展现优势的另一重要场景。OpenAI 将其称为“迄今最适合编程的模型”,这一结论得到多项测试支持:在 Terminal-Bench 4.0 终端操作测试中,Astra 得分 57.7%,显著高于 GPT-5.6 Sol 的 37.3% 和 Claude Fable 5.1 的 55.8%;在 DeepSWE v1.1 真实软件工程任务测试中,其得分超过 74%。这意味着程序员以往需反复调试的代码任务,现在可由 Astra 自主完成从需求理解、代码编写到运行测试的全流程。
针对编程助手的上下文管理痛点,Astra 引入了革命性改进。当上下文窗口容量达到上限时,传统模型会通过压缩总结历史内容,但这一过程会导致细节丢失;而 Astra 可保存完整上下文,允许用户跨窗口检索早期注释和累积信息,无需将其压缩为单一摘要。对于需要持续数天、涉及数万行代码的大型项目,这一功能极大提升了开发连续性和代码质量。
更令人惊讶的是 Astra 在抽象推理能力上的飞跃。在 ARC-AGI-3 测试中,其成绩从 GPT-5.6 Sol 的 7.8% 飙升至 99.9%,接近理论满分。该测试专门设计陌生环境下的抽象推理任务,被视为衡量模型“真智能”而非“记忆能力”的核心指标。在高阶数学领域,Astra 在 FrontierMath Tier 4 测试中取得 97.6% 的高分,展现出接近专业数学家的解题能力。
支撑这些突破的是前所未有的训练规模。Astra 在得州 Stargate 基地动用超过 10 万块 GPU 完成预训练,并首次采用前代模型深度参与监督训练的创新模式——用 GPT-5 指导 GPT-6 的训练过程,形成自我迭代的闭环。这种训练方式效率远超传统人工标注,成为 Astra 能在两个月内实现跨越式发展的关键因素。
随着能力提升,安全性成为关注焦点。OpenAI 强调 Astra 是“最对齐的模型”,并公布多项安全评估数据:在模拟越权操作的测试中,关闭生产环境保障措施后,GPT-5.6 Sol 有 48% 的测试出现越界行为,而 Astra 保持零越界;在故意关闭代码审查功能的测试中,Astra 生成不安全代码的概率也显著低于前代模型。
目前 Astra 尚未全面开放使用,OpenAI 正逐步向部分组织用户开放权限,更广泛的可用性计划在未来数日内启动。在 API 定价方面,Astra 输入成本为每百万 token 10 美元,输出成本为每百万 token 50 美元,是 GPT-5.6 Sol 的 2.5 倍。这一定价策略意味着普通个人用户短期内难以低成本大规模使用,但对企业和专业用户而言,效率提升带来的收益可能远超成本增加。
不同职业群体对 Astra 的价值感知存在显著差异:程序员可将其视为能独立完成模块开发的初级工程师;办公人员能获得自动制作 PPT、整理表格、处理邮件的行政助手;科研人员可借助其分析数据、运行模拟、生成图表;企业管理者则需重新规划人力结构,因为大量重复性知识工作将被自动化替代。但需注意的是,Astra 并非万能——其在网络安全领域的提升相对温和,复杂多步骤任务仍可能出错,最终交付物仍需人工审核。AI 的进化方向并非完全取代人类,而是承担更多基础性、重复性工作,让人类专注于创造力和判断力要求更高的领域。
从 GPT-3 到 GPT-4,人工智能展现了更强的对话能力;从 GPT-4 到 GPT-5,模型进化为更专业的助手;而 Astra 的出现,标志着 AI 从“回答问题”升级为“完成任务”。这种转变的本质在于交互模式的革新——用户无需再拆解任务步骤,只需设定目标,AI 即可自主规划实现路径。尽管现在断言 AGI 时代已经到来为时尚早,但 Astra 的问世无疑是一个重要信号:AI 正在从工具演变为能独立承担工作的数字劳动力,掌握与这类 AI 协作的能力,将成为知识工作者的核心竞争力。




















