可协助 AI 语言模型改善自我纠错能力,谷歌推出 BIG-Bench Mistake 数据集
2024 年 1 月 15 日
谷歌研究院创建了一个名为「BIG-Bench Mistake」的专用基准数据集,用于评估大语言模型的出错概率和自我纠错能力。研究人员通过在 BIG-Bench 基准测试任务中运行 PaLM 语言模型,并修改其生成的思维链轨迹,形成了包含 255 项逻辑错误的数据集。测试结果显示,虽然大部分语言模型能识别并修正推理过程中的逻辑错误,但效果尚不理想,通常需人工干预。谷歌认为,专有小型模型可用于监督大型模型,以提高纠错能力、降低 AI 部署成本。
2026-08-13
手语人工智能首次进入消费级:谷歌 DeepMind 推出手语转文本模型2025-11-03
谷歌 CEO 皮查伊确认:下一代 AI 模型 Gemini 3 今年发布2025-10-08
谷歌发布 Gemini 2.5 Computer Use 模型:专攻浏览器交互2025-09-17
谷歌发布长上下文基础模型 TimesFM-2.52025-09-09
谷歌 AI 模式新增五种语言,扩展全球用户访问2025-09-03
谷歌 AI 推出 Stax:帮助开发者根据自定义标准评估大语言模型2025-05-31
谷歌 DeepMind 推出 SignGemma,手语翻译新突破,助力无障碍沟通2025-05-12
谷歌引入 AI 反诈系统:利用语言模型分析潜在恶意网站2025-03-13
谷歌 DeepMind 推出新 AI 模型,机器人未经训练也能执行现实任务查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。