当前位置:首页 > 元宇宙 > AI

苹果研究员质疑AI:简单数学题一改就出错?

来源: 责编: 时间:2024-10-12 16:25:52 170观看
导读【ITBEAR】近年来,人工智能(AI)在各个领域取得了显著进展,尤其是大型语言模型(LLM),它们能够生成人类水平的文本,甚至在某些任务上超越人类。然而,一项新研究对LLM的推理能力提出了质疑。苹果公司的一组研究人员发现,这些模型在

【ITBEAR】近年来,人工智能(AI)在各个领域取得了显著进展,尤其是大型语言模型(LLM),它们能够生成人类水平的文本,甚至在某些任务上超越人类。然而,一项新研究对LLM的推理能力提出了质疑。苹果公司的一组研究人员发现,这些模型在解决简单数学问题时,只要问题稍有变动,就容易出错,暗示它们可能并不具备真正的逻辑推理能力。l2b28资讯网——每日最新资讯28at.com

l2b28资讯网——每日最新资讯28at.com

研究人员在一篇名为《理解大型语言模型中数学推理的局限性》的论文中揭示了LLM在解决数学问题时易受干扰的现象。他们通过对数学问题进行微小改动,例如添加无关信息,来测试LLM的推理能力。结果发现,面对这样的变化,模型的表现急剧下降。l2b28资讯网——每日最新资讯28at.com

例如,当给出一个简单的数学问题:“奥利弗星期五摘了44个奇异果,星期六摘了58个。星期日,他摘的是星期五的两倍。他一共摘了多少个?”LLM能正确回答。但若添加无关细节:“星期日摘的是星期五的两倍,其中5个比平均小。”LLM的回答则出错。GPT-o1-mini的回答是:“...星期日,其中5个奇异果比平均小。我们需要从总数中减去它们:88 - 5 = 83个。”l2b28资讯网——每日最新资讯28at.com

这只是一个例子,研究人员修改了数百个问题,几乎所有改动都导致模型回答成功率大幅下降。他们认为,这表明LLM并未真正理解数学问题,而只是根据训练数据中的模式进行预测。一旦需要真正的“推理”,如是否计算小的奇异果,它们就会产生不合常理的结果。l2b28资讯网——每日最新资讯28at.com

这一发现对AI的发展具有启示意义。尽管LLM在许多领域表现出色,但其推理能力仍有局限。未来,研究人员需进一步探索如何提高LLM的推理能力,使其更好地理解和解决复杂问题。l2b28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-45-9250-0.html苹果研究员质疑AI:简单数学题一改就出错?

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 方程豹豹8预售开启,40-50万元,年内上市交付!

下一篇: 上海交大新突破!AI预警平台,首次实现孕前预测流产风险?

标签:
  • 热门焦点
  • 元宇宙是投资中国的第五次重大机遇

    作者为凯思博投资董事长导语:投资逻辑要来自于人性在社会发展过程中的普遍规律,由第一性原理出发找出重大的投资机会来。1978年的改革开放到今天,中国总共经历了
  • 保时捷推出虚拟超跑,车企元宇宙营销这么香?

    保时捷又出超跑了,不过这次不是在现实世界,而是在虚拟世界。这款Vision Gran Turismo概念车,由保时捷和日本视频游戏开发工作室Polyphony Digital联合打造,将于202
  • 现在的元宇宙:一款低配版的科幻游戏

    在2021年的岁末之际,不禁感叹元宇宙元年之热闹,从元宇宙NFT头像,到元宇宙数字地产,再到元宇宙旅游景区等等,仿佛科幻感十足的元宇宙眨眼间就从人们的概念认知中完全
  • “虚拟人”角斗场,基于“硬实力”下的人性平衡法则?

    在打工人“反内卷”的当下,一众虚拟人却“内卷”了起来。从北京春晚虚拟人苏小妹与刘宇演绎歌舞《星河入梦》,央美毕业的虚拟人夏语冰登上央视节目《对话》,湖南
  • 元宇宙画廊体验报告:有点头疼。

    2 月 10 日,Hrishi Rajasekar 在旧金山铸币厂的沉浸式 NFT 展览 Verse 观看增强现实艺术品。“我们现在在虚拟世界中吗?时间好像变长了” 我问身后排队的人。我
  • 以太坊面临来自Fantom的巨大挑战

    众所周知,区块链和加密货币项目经常因其对环境的影响而受到批评。但是有一个非营利性的加密货币和区块链项目说它比其他的更环保。今天老雅痞就给大家聊一聊加
  • 头像类NFTs的统治能持续多久?

    在过去的一两年里,NFTs在互联网世界中掀起了一场风暴。今天,当我们想到NFTs时,我们主要想到的是那些充斥着我们的社交媒体屏幕的数字卡通--无聊猿、punks 和介于
  • 爆发在即的Layer2赛道百花齐放,谁将是领跑者?

    还记得几年前最早我们提起ETH扩容,首先想到就是Layer2,而Layer2里,首先想到的是闪电网络,状态通道,Plasma…然后折腾了几年,发现并没有什么用,许多项目方和资本也等不
  • 虚拟人行业研究报告

    最早的虚拟人出现于 20 世纪 80 年代,受限于技术,当时的虚拟人制作以手绘为主。21 世纪初,随着动捕、渲染等技术的逐步发展,虚拟人相关技术开始在影视领域逐渐普及
Top