观点网讯:9月8日,谷歌、Meta最新的Gemini 3.8 Flash与Muse Spark 1.3在第三方榜单上一度反超Anthropic及OpenAI旗舰模型,有分析认为两家新模型存在针对榜单评测刷分的过拟合情况。
对于跑分作弊指控,谷歌方面暂无回应。Meta AI业务主管Alexandr Wang反驳称该论点站不住脚,不同难度基准分数本就不同。
Wang以OpenAI的GPT-5.6 Sol在TerminalBench 2.1拿到88.8%、在TerminalBench 4.0为37.3%为例,称旧基准已饱和、新基准未饱和。
Wang表示,未来大模型会更直接地与两家旗舰竞争。
免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。