分析机构指谷歌 Meta 模型刷榜,双方各执一词
上周六
分析机构 SemiAnalysis 发文指出谷歌 Gemini 3.8 Flash 和 Meta Muse Spark 1.3 刷榜痕迹明显。在 Terminal-Bench 2.1 榜单上二者成绩优异,Gemini 3.8 Flash 排第 2,Muse Spark 1.3 排第 4,但在新增防作弊机制、更新题目的 Terminal-Bench 4.0 榜单上,前者暴跌至 19.1 分排第 12,后者为 33.3 分,成绩大幅下滑。Meta 首席 AI 官对此反驳,称 GPT-5.6 Sol 落差更大却未被指刷榜,且 Muse Spark 1.3 主打性价比。SemiAnalysis 还揭露行业刷榜高阶玩法:大厂不再直接用原题训练,而是购买贴近公开榜单题型的训练数据,相关产业链已成熟,单季合同均价达 30 万到 50 万美元,供给侧有众多公司参与。此外,Datacurve 公司既运营 DeepSWE 榜单,又出售相关训练数据,被指既当卖题机构又当监考老师。SemiAnalysis 认为公开基准终将被「刷穿」,建议做高质量私有基准,但这会使公开榜单沦为营销工具,开发者将失去公平丈量模型的公共标尺。
谷歌 Meta 被锤刷榜
36Kr
谷歌 Meta 被锤刷榜 Gemini 暴跌 70 分,Top 2 秒变倒数第三
新智元 / 智源社区
2026-09-12
分析机构指谷歌 Meta 模型刷榜,双方各执一词2026-08-28
谷歌 Gemini 3.8 Flash 模型已进入内部测试2026-07-17
谷歌 Gemini 3.5 Pro 发布推迟,技术能力未达预期目标2026-02-15
谷歌 Gemini 遭遇大规模蒸馏攻击,单次行动提示超 10 万次2025-12-23
《纽约时报》记者指控 Meta、谷歌及 OpenAI 等侵犯版权2025-11-04
谷歌将 Gemma 移出 AI 工作室2025-11-03
谷歌因虚假指控争议从 AI Studio 下架 Gemma 开源模型2025-11-03
谷歌 CEO 皮查伊确认:下一代 AI 模型 Gemini 3 今年发布查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。