谷歌、OpenAI学者谈AI:语言模型正在努力「攻克」数学

2022-11-02 15:51:03   来源:商业新知网

【导读】 AI 到底擅不擅长数学,还得具体问题具体分析。

如果问计算机擅长什么,在所有的答案里,数学必须榜上有名。在经历了漫长的研究之后,顶尖学者们在研究计算机关于数学计算方面的发展,取得了令人惊讶的成绩。


(相关资料图)

就拿去年来说,来自加州大学伯克利分校、OpenAI 和 Google 的研究人员在语言模型方面取得了长足的进步,GPT-3、DALL·E 2 等被开发出来。然而,直到现在,语言模型还无法解决一些简单的、用语言描述的数学问题,例如「Alice 比 Bob 多五个球,Bob 在给 Charlie 四个球后有两个球。问 Alice 有几个球?」这对语言模型来说,想要给出正确答案,可能就有点「吃力」了。

「当我们说计算机非常擅长数学时,意思是它们非常擅长特定的、具体的事情,」来自谷歌的机器学习专家 Guy Gur-Ari 表示。计算机擅长算术是不假,但在特定的模式之外,计算机就无能为力了,简单的文字描述题都回答不了。

谷歌研究员 Ethan Dyer 曾经表示:做数学研究的人有一套僵化的推理系统,对于他们熟知的和不了解的内容,这两者之间有着明显的鸿沟。

解决文字问题或定量推理问题很棘手,因为不同于其他问题,这两者需要鲁棒性和严谨性。如果过程中的任何一步出现错误,将会导致错误的答案。DALL·E 在绘画方面令人印象深刻,尽管它生成的图像有时会很奇怪,可能遗漏人的手指、眼睛长得奇怪…… 这些我们都能接受,但是它在数学方面出现了错误,我们的容忍度就会非常小。来自 OpenAI 的机器学习专家 Vineet Kosaraju 也曾表达过这种想法,「我们对语言模型所犯的数学错误(比如将 10 误解为 1 和 0,而不是 10)容忍性还是比较小的。」

「我们研究数学仅仅是因为我们发现它独立且非常有趣,」OpenAI 机器学习专家 Karl Cobbe 说。

随着机器学习模型在更大的数据样本上训练而成,它们的鲁棒性更好、出错也更少。但扩大模型规模似乎只能通过定量推理进行。研究人员意识到,对于语言模型所犯的错误似乎需要更有针对性的方法来解决。

去年,加州大学伯克利分校和 OpenAI 的两个研究团队分别发布了数据集 MATH 和 GSM8K,这两个数据集包含几何、代数、初等数学等数千个数学问题。「我们想看看这是否是数据集的问题,」从事数学工作的 AI 安全中心研究员 Steven Basart 说。众所周知,语言模型不擅长单词问题,在这个问题上它们表现的有多糟糕,是否可以通过引入格式更好、更大的数据集来解决?

在 MATH 数据集上,顶级语言模型的准确率为 7%,而人类研究生的准确率为 40%,奥林匹克冠军的准确率为 90%。在 GSM8K 数据集上(小学级别的问题),模型达到了 20% 的准确率。实验中 OpenAI 使用了微调和验证这两种技术,结果表明模型可以看到很多自身错误的例子,这一发现很有价值。

当时,OpenAI 的模型需要在 100 倍以上的数据上进行训练,才能在 GSM8K 上达到 80% 的准确率。但在今年 6 月,谷歌发布了 Minerva,达到 78% 的准确率。这一结果超出了预期,研究者表示,比预想的时间来的更快。

论文地址:https://arxiv.org/pdf/2206.14858.pdf

Minerva 基于谷歌自研的 Pathways 语言模型 (PaLM),具有更多的数学数据集,包含 arXiv、 LaTeX 等数学格式。Minerva 还采用了其他策略,在思维链提示(chain-of-thought prompting)中,Minerva 将更大的问题分解成小块。此外,Minerva 还使用多数投票(majority voting),不是要求模型给出一个答案,而是要求它提出 100 种答案。在这些答案中,Minerva 选择最常见的一种答案。

这些新策略的收益是巨大的,Minerva 在 MATH 上的准确率高达 50%,在 GSM8K 以及 MMLU(包括化学和生物学在内的一组更通用的 STEM 问题)上的准确率接近 80%。当 Minerva 被要求重做稍微调整过的问题时,它的表现同样很好,这表明它的能力不仅仅是来自记忆。

Minerva 可能有奇怪、混乱的推理,但仍然得出正确的答案。尽管像 Minerva 这样的模型可能会得出与人类相同的答案,但它们所遵循的实际过程可能大不相同。

谷歌机器学习专家 Ethan Dyer 表示,「我认为存在这样一种观念,即数学相关人士有一些严格的推理系统,了解某事和不了解某事之间存在明显的区别。」但人们给出的答案不一致,会犯错误,也无法应用核心概念。在机器学习前沿中,边界是模糊的。

关键词: 语言模型 机器学习

上一篇:
下一篇:
精彩阅读

谷歌、OpenAI学者谈AI:语言模型正在努力「攻克」数学

热点

AI到底擅不擅长数学,还得具体问题具体分析。

SaaS:订阅未来

热点

说到SaaS就不能不说服务,而服务就离不开订阅。订阅运用能力,决定了一家SaaS创业公司有没有未来。

消除AI偏见从数据开始

热点

人类的偏见比AI的偏见更难消除。

全球最新:数据中台的终点是DataOps还是DaaS?

热点

要说近些年企业服务圈的顶流明星,非数据中台莫属。

世界快资讯:关于文本到图像生成式AI :狂野新世界的4 个预测

热点

一种强大的新形式的人工智能突然出现并吸引了公众的想象力:文本到图像的生成式人工智能。

【独家】广电192靓号官方申请攻略来了!“球迷卡”即将上线!

热点

随着2022年卡塔尔世界杯的临近,中国广电方面也针对性的发出了新的广电5G营销推广活动信息。

观察:“葬爱家族”,在小红书重生

热点

“葬爱家族”复活记:铁打的边缘人。

观速讯丨互联网应用软件衰落记:属于超级APP的时代过去了?

热点

日益臃肿的微信也一直被外界吐槽:实际上90%左右的更新都用不到。

世界微头条丨数字经济的强逻辑

热点

人工智能驾驭下的数据,成为推动新一轮经济增长的决定性要素。那么这就是人口结构恶化下的一个强对冲。

天天观天下!红杉资本谈生成式AI:预计AI的杀手级应用将出现,比赛正在进行

热点

生成式AI还很早期。平台层刚刚好,而应用空间几乎还没开始。但预计AI的杀手级应用将出现,比赛正在进行。

财富

全球快消息!融资丨「江行智能」完成1.5亿元pre-B轮融资,朗玛峰资本等机构投资

资讯

融资丨「江行智能」完成1 5亿元pre-B轮融资,朗玛峰资本等机构投资,本轮融资将主要用于技术创新、双碳相关解决方案研发、创新应用场景与业务拓

今日看点:融资丨「六方云」完成C1轮2亿元融资,北创投领投

资讯

融资丨「六方云」完成C1轮2亿元融资,北创投领投,六方云将把本轮融资主要用于核心技术及产品上下游产业布局、市场拓展、人才队伍和平台建设等。

融资丨「HealthJoy」获得6000万美元D轮融资,Valspring领投

资讯

融资丨「HealthJoy」获得6000万美元D轮融资,Valspring领投,HealthJoy公司将把这笔资金用于公司持续增长。

蹭韩流起家年入36亿,昔日“第一微商”三战IPO

资讯

蹭韩流起家年入36亿,昔日“第一微商”三战IPO,屡次抓住时代红利的韩束,还能再战吗?

冬日情绪消费:去年热煮红酒,今年围炉烤茶

资讯

冬日情绪消费:去年热煮红酒,今年围炉烤茶,天冷了,需要更多 "温暖 "。

焦点短讯!网球名将威廉姆斯姐妹领投,投资社交平台Shares完成4000万美元融资丨海外邦

资讯

网球名将威廉姆斯姐妹领投,投资社交平台Shares完成4000万美元融资丨海外邦,Williams姐妹也将担任该公司的形象大使。

焦点快报!2022狂赚1.7亿,谷爱凌跻身全球女运动员吸金榜Top5

资讯

2022狂赚1 7亿,谷爱凌跻身全球女运动员吸金榜Top5,谷爱凌过去一年共获得2300万美元的商业代言收入。

环球要闻:奈雪专心搞副业

资讯

奈雪专心搞副业,奈雪的面包生意,越做越上头了。

万元学费,只赚400块,网红副业把我整焦虑了

资讯

万元学费,只赚400块,网红副业把我整焦虑了,“小美”和“大壮”背后的生意经

泡泡玛特回不了暖

资讯

泡泡玛特回不了暖,涨不上去的业绩,留不住的消费者。

SaaS:订阅未来

说到SaaS就不能不说服务,而服务就离不开订阅。订阅运用能力,决定了一家SaaS创业公司有没有未来。

消除AI偏见从数据开始

人类的偏见比AI的偏见更难消除。

全球最新:数据中台的终点是DataOps还是DaaS?

要说近些年企业服务圈的顶流明星,非数据中台莫属。

世界快资讯:关于文本到图像生成式AI :狂野新世界的4 个预测

一种强大的新形式的人工智能突然出现并吸引了公众的想象力:文本到图像的生成式人工智能。

【独家】广电192靓号官方申请攻略来了!“球迷卡”即将上线!

随着2022年卡塔尔世界杯的临近,中国广电方面也针对性的发出了新的广电5G营销推广活动信息。

苹果举行主题为超前瞻秋季新品发布会 AirPodsPro2正式登场

北京时间9月8日凌晨,苹果举行主题为超前瞻的秋季新品发布会,在此次发布会上,备受关注的iPhone 14系列新机、新款Apple Watch Ultra以

微软正为Windows12开发新驱动框架 提升新老显卡性能

Windows 12系统可能会在2024年到来,按照正常的节奏,其开发工作应该早已秘密进行。日前,有开发者从Windows 11最新预览版Build 25188中

华盛顿地铁站首次亮相为视障人士扩展旅行路线

5月25日消息,一款旨在帮助视障人士或盲人行人使用公共交通工具的应用程序在华盛顿地铁站首次亮相。该应用程序名为Waymap,旨在为盲人和视

2022年情况又要变了!华硕高管:今年PC恐怕要供过于求

这两年来,由于疫情导致的居家办公及远程教育需求爆发,一直在下跌的PC市场枯木逢春,2021年更是创下了2012年以来的最快增长,然而2022年情

垃圾佬的心头好!西数新款固态盘SN740曝光

对于DIY垃圾佬来说,散片、拆机件、工包……这些名词怕是并不陌生。本周,西数推出了主要供应OEM厂商的新款固态盘SN740。SN740升级到了第五

虚假宣传、误导消费者 倍至冲牙器关联公司被处罚

后来者要想在激烈的市场竞争中立足,如果可以背靠巨头享受大树底下好乘凉的红利,那自然是皆大欢喜,没有这个福气,也大可凭借自己一步一个