Meta高管回应AI跑分作弊指控 称不同基准分数本就不同
创始人
2026-09-09 07:44:43
0

观点网讯:9月8日,谷歌、Meta最新的Gemini 3.8 Flash与Muse Spark 1.3在第三方榜单上一度反超Anthropic及OpenAI旗舰模型,有分析认为两家新模型存在针对榜单评测刷分的过拟合情况。

对于跑分作弊指控,谷歌方面暂无回应。Meta AI业务主管Alexandr Wang反驳称该论点站不住脚,不同难度基准分数本就不同。

Wang以OpenAI的GPT-5.6 Sol在TerminalBench 2.1拿到88.8%、在TerminalBench 4.0为37.3%为例,称旧基准已饱和、新基准未饱和。

Wang表示,未来大模型会更直接地与两家旗舰竞争。

免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。

相关内容

热门资讯

长征五号B遥一运载火箭顺利通过... 2020年1月19日,长征五号B遥一运载火箭顺利通过了航天科技集团有限公司在北京组织的出厂评审。目前...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
湖北省黄冈市人大常委会原党组成... 据湖北省纪委监委消息:经湖北省纪委监委审查调查,黄冈市人大常委会原党组成员、副主任吴美景丧失理想信念...
《大江大河2》剧组暂停拍摄工作... 搜狐娱乐讯 今天下午,《大江大河2》剧组发布公告,称当前防控疫情是重中之重的任务,为了避免剧组工作人...