GPT-6 Astra 與 AGI 競爭:新基準測試領先與前沿模型半通用商品化
- —雖然在 AAII 臨時指標暫居次席,但 GPT-6 Astra 在科學代理(Terminal-Bench 4.0/Sci)、企業自動化(Automation-Bench)及 ARC-AGI-3 等新基準上全面超越 Fibot 5.1,且推論成本顯著降低。前沿 AI 模型正逐步演化為半通用商品,多數任務具備高度替代性,個別架構僅在特定利基保有差異化優勢
GPT-6 Astra 幻覺率大幅降至 2% 且越權風險歸零,展現高可靠度;評測得分在人類主觀偏好落後預期可透過 post-training 快速修正。前沿模型競爭已從單一基準分數轉向實際工作場景的成本效益與任務可靠度