新闻中心

首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath

2024-07-12
浏览次数:
返回列表

获胜的 ai 数学奥林匹克模型出炉!

易标AI 易标AI

告别低效手工,迎接AI标书新时代!3分钟智能生成,行业唯一具备查重功能,自动避雷废标项

易标AI 135 查看详情 易标AI

几天前,随着榜单的公布,大家对全球首届 AI 数学奥林匹克竞赛(AIMO)进步奖的讨论量居高不下。

这次比赛共有 5 个团队胜出,获得第一名的是 Numina 的团队,CMU_MATH 位列第二,after exams 暂居第三,codeinter、Conor #2 团队分别拿到第四、第五的成绩。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
                             图源:https://www.kaggle.com/c/ai-mathematical-olympiad-prize/leaderboard

这一成绩,曾让陶哲轩感到惊讶。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
当时官方只公布了获奖名单,并未透漏背后模型的更多信息。大家都在好奇,获得冠军的队伍到底是用了哪种模型?

刚刚,AIMO 进步奖公布了前四名背后模型。

冠军团队用到的模型是 NuminaMath 7B TIR,该模型是 deepseek-math-7b-base 的微调版本。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
获得第二名的队伍微调了两个 DeepSeek-Math-7B-RL 模型,一个用作策略模型(用于生成解决方案),一个用作奖励模型(用于对加权多数投票的解决方案进行评分)。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
第三名同样使用了 DeepSeek-Math-7B-RL 模型,没有进行任何微调,并通过制定的评分规则使用多数投票的策略选择正确答案。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
排名第四的队伍同样使用了 deepseek-math-7b-rl,参数设置 temperature 为 0.9、top_p 为 1.0、max tokens 为 2048。该模型搭配代码工具,在 MATH 基准测试中可达到 58.8%。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
我们不难发现,排名前四的队伍都选择了 DeepSeekMath-7B 作为基础模型,并取得了较好的成绩。该模型数学推理能力逼近 GPT-4,在 MATH 基准榜单上超过一众 30B~70B 的开源模型。

冠军:NuminaMath 7B TIR 模型

接下来,就让我们详细看下这场比赛的冠军方案。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
NuminaMath 是一系列语言模型,经过训练可以使用工具集成推理(TIR)解决数学问题。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
NuminaMath 7B TIR 是 deepseek-math-7b-base 的微调版本,进行了两个阶段的监督微调:

  • 第 1 阶段:在自然语言数学问题和解决方案的大型、多样化数据集上微调基本模型,其中每个解决方案都使用思维链 (CoT) 进行模板化以促进推理。
  • 第 2 阶段:在工具集成推理(TIR)的合成数据集上微调第 1 阶段得到的模型,其中每个数学问题都分解为一系列基本原理、Python 程序及其输出。这里会 prompt GPT-4 生成带有代码执行反馈的 ToRA 格式(微软)解决方案。在这些数据上进行微调会产生一个推理智能体,它可以通过结合自然语言推理和使用 Python REPL 来计算中间结果,以解决数学问题。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath
值得注意的是,NuminaMath 7B TIR 是专门为了解决竞赛级别数学问题而创建的。因此,该模型不应用于一般聊天应用程序。通过贪婪解码(greedy decoding),冠军团队发现该模型能够解决 AMC 12 级别的问题,但通常很难为 AIME 和数学奥林匹克级困难问题生成有效的解决方案。该模型还难以解决几何问题,可能是因为其容量有限且缺乏视觉等模态。
首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath

以上就是首届AI奥数竞赛方案公布:4支获奖队伍,竟都选择国产模型DeepSeekMath的详细内容,更多请关注其它相关文章!


# python  # deepseek  # follow  # type  # 奥数  # 产业  # 五大  # 吴江网站关键词推广公司  # SEO学习壁纸ipad  # 拒绝黑帽seo优化  # 网站建设在线报价  # 延吉施工建设招标网站  # 之争  # 新能源  # 都能  # 自然语言  # 华纳  # 南极  # 的是  # 奥林匹克  # 十堰 网站建设  # 医疗网站建设方案模板  # 宠物店的营销推广方式  # 推广营销运营方法全集  # 崇明公司网站建设招聘 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 交管12123协议头是什么  ensp命令如何提示  j*a怎么把数组输出  哪些框架支持typescript  typescript如何使用  j*a 怎么清空数组元素  datediff函数怎么用视频  单片机软件keil怎么运行  8k是多少钱  怎么下载360桌面壁纸  如何通过dos命令  固态硬盘如何检查  360手机壁纸怎么改  阿里云盘共享账户怎么用  i5 6500怎么装win7  如何开发typescript  typescript和node学哪个  市盈率为负值是什么意思  汽车排量是什么意思  vfp 命令窗口如何实现换行  如何查询固态硬盘序列  春运哪天抢票最好  市盈率20a21e是什么意思  春运抢票可以抢几次票  如何安装tree命令  如何使用程序编译 执行的命令  电瓶车充电器power是什么意思  如何创建解压文件命令  nfc近场通讯功能是什么意思  j*a map数组怎么取值  固态硬盘如何启动  driver是什么意思  hp固态硬盘如何安装  typescript的语法格式是什么  360n5锁屏壁纸怎么设置  type-c输入接口是什么  折叠屏手机为什么凉凉  混合固态硬盘如何分区  夸克投屏为什么那么卡  市盈率中1stdv是什么意思  bc是什么意思  vivo怎么投屏到电视看爱奇艺教程  如何查看邮件域名解析  什么是夸克模组文件格式  酷狗音乐pc版的每日推荐在哪 酷狗音乐PC版每日推荐查找指南  喇叭上POWER4欧是什么意思  单片机蜂鸣器响了怎么停  adb 命令如何后台运行  dos命令 如何将变量 作为路径的一部分  如何利用运行命令查看声音启动 

搜索