OpenAI 遭爆調整 GPT-6 Astra 評測數據,部分指標出現顯著變動
據《財富》(Fortune)報導,OpenAI 發布 GPT-6 Astra 後,多次修改模型評測頁面數據,導致部分指標出現大幅波動。其中 Astra 的內部幻覺率曾由 4.2% 調整至 2% 後又恢復為 4.2%,而 Anthropic(Anthropic) 的 Fable 5.1 在 FrontierMath Tier 4 的成績亦曾下調後回升。此外,Astra 在 ARC-AGI-3 的成績從 98.6% 提升至 99.99%。OpenAI 對此回應稱,評測數據波動源於模型檢查點與測試運行方式的差異,調整旨在反映更準確的性能。市場分析指出,AI 產業存在透過調整測試條件以優化基準測試成績的「Benchmaxxing」現象。
摘要由 AI 依據原文撰寫,並非投資建議。