新闻中心

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

2024-12-19
浏览次数:
返回列表

大型语言模型(llm)在数学竞赛基准测试中表现出色,得分动辄80%甚至90%以上,但在实际应用中却往往表现不佳。对此,上海人工智能实验室司南opencompass团队开发了新的复杂数学评测集livemathbench,并引入了新的性能指标g-pass@16,以更全面地评估模型的性能潜力和稳定性。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

该团队通过模拟真实用户使用场景,对多个LLM进行了多次测试,结果显示:大多数模型的性能平均下降超过50%,即使是最强的推理模型o1-mini也下降了36%。有些模型的性能下降甚至高达90%。

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

G-Pass@k:兼顾性能潜力与稳定性的新指标

研究团队对传统指标如Pass@k、Best-of-N和Majority Voting进行了改进,这些指标主要关注模型的潜在能力,而忽略了鲁棒性。在实际应用中,模型常采用采样解码,这会引入随机性,影响模型的性能。用户期望模型在真实场景中表现稳定可靠。

因此,团队提出了G-Pass@k指标,它通过引入阈值,评估模型在多次生成中至少给出一定数量正确答案的概率。 当阈值较低时,G-Pass@k反映模型的性能潜力;当阈值较高时,它反映模型的稳定性。 Pass@k实际上是G-Pass@k在阈值为1时的特例。

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

团队还定义了mG-Pass@k,它是G-Pass@k曲线的面积,用于整体评估模型性能,尤其关注0.5到1.0之间的阈值范围。

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

LiveMathBench:一个更真实的评测集

为了进行更客观的评估,团队构建了LiveMathBench,该数据集包含来自中国数学奥林匹克、中国高考模拟题、美国数学竞赛和普特南数学竞赛的题目,尽可能减少数据污染。 LiveMathBench (202512版本) 包含238道题目,提供中英文双版本。 团队计划持续更新该数据集。 实验还涵盖了MATH500-L5和AIME2025-45两个公开基准数据集。

千鹿Pr助手 千鹿Pr助手

智能Pr插件,融入众多AI功能和海量素材

千鹿Pr助手 128 查看详情 千鹿Pr助手

实验结果与分析

实验中,每个题目进行了48次(16次采样*3次重复)生成,并报告G-Pass@16分数。结果显示:

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了

主要观察结果:

  1. 稳定性差: 闭源和开源模型在复杂推理任务中的稳定性都非常差,G-Pass@16(1.0) 的分数普遍很低,性能下降幅度巨大。

  2. 规模并非万能: 增大模型规模对推理能力的提升有限,甚至可能导致性能下降。

  3. 潜力与实际表现差距大: 模型的潜在能力(例如Greedy Accuracy)与实际稳定表现(G-Pass@16(1.0))之间存在巨大差距。

结论

这项研究揭示了当前LLM在复杂数学推理方面的局限性,尤其是在稳定性和鲁棒性方面。 G-Pass@16指标和LiveMathBench数据集为更全面地评估LLM的数学推理能力提供了新的工具,也为未来的研究指明了方向。 研究人员呼吁学术界和工业界关注LLM推理能力的鲁棒性问题。

以上就是GPT-4o数学能力跑分直掉50%,上海AI Lab开始给大模型重新出题了的详细内容,更多请关注其它相关文章!


# 数学评测  # 福建莆田海外营销推广  # 推广运营如何营销产品  # 和龙百度网站优化  # 多场  # 开好  # 中国  # 首个  # 数学竞赛  # 腾讯  # 都能  # 进行了  # 开源  # 上海  # ai  # 大模型  # 光明seo选哪家  # 重庆德阳网站建设  # 网站建设心得文案  # 惠州网站排行优化  # 湖南建设工程采购网站  # 海阳市seo优化关键词  # 鹤山网站建设设计订做 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 春运抢票最新技巧与方法  j*a数组怎么保存类  单片机蓝牙怎么开启设备  如何用chown命令  关系型数据库和非关系型数据库有哪些  折叠屏手机为什么没火  哪些库是typescript  路由器power灯一直亮是什么意思  三菱变频器POWER是什么意思  市盈率tt的扣非是什么意思  望远镜上power是什么意思  域名批量查询工具有哪些  阿里云盘扩容工具怎么用  征信不好如何恢复信誉度 ‌征信不好恢复信誉度的方法  镜像ao3链接入口  单片机.lib文件怎么打开  苹果16有哪些亮点功能  苹果16主打颜色有哪些  导航power在汽车上是什么意思  破太岁是什么意思  如何通过命令行启动tomcat  苹果16更新了哪些版本  如何在命令行写j*a程序  苹果16有哪些系统  mac如何使用vi命令  oppo手机nfc功能是什么意思  如何用固态硬盘做缓存  摩托车上power是什么意思  固态硬盘如何查看盘符  春运抢票哪个城市好抢  如何提高固态硬盘性能  typescript怎么加号  j*a中如何创建列表数组  如何体验苹果16系统  没网环境如何安装typescript  手机全功能type-c接口是什么意思  汽车的type-c接口是什么  智能锁type-c接口是什么  苹果16有哪些黑科技  五十铃x-power是什么意思  苹果16会升级哪些  如何用命令打开光驱  苹果16系统多了哪些  输入命令如何换行  如何使用ping命令  一尺是多少厘米  如何去掉拍电脑的纹路详细教程  阿里云盘的会员怎么用  如何把u盘改成固态硬盘  如何以管理员身份打开命令提示符 

搜索