当前位置：首页 > 元宇宙 > AI

OpenAI o3 模型基准测试成绩遭质疑，实测分数远不及宣称

来源：责编：时间：2025-04-23 10:26:33 225观看

导读 4 月 21 日消息，OpenAI 的 o3 人工智能模型的第一方与第三方基准测试结果存在显著差异，引发了外界对其公司透明度和模型测试实践的质疑。去年 12 月，OpenAI 首次发布 o3 模型时宣称，该模型能够在 FrontierMath 这

4 月 21 日消息，OpenAI 的 o3 人工智能模型的第一方与第三方基准测试结果存在显著差异，引发了外界对其公司透明度和模型测试实践的质疑。

去年 12 月，OpenAI 首次发布 o3 模型时宣称，该模型能够在 FrontierMath 这一极具挑战性的数学问题集上正确回答超过四分之一的问题。这一成绩远远超过了竞争对手 —— 排名第二的模型仅能正确回答约 2% 的 FrontierMath 问题。OpenAI 首席研究官 Mark Chen 在直播中表示：“目前市场上所有其他产品在 FrontierMath 上的成绩都不足 2%，而我们在内部测试中，使用 o3 模型在激进的测试时计算设置下，能够达到超过 25% 的正确率。”

然而，这一高分似乎是一个上限值，是通过一个计算资源更为强大的 o3 模型版本实现的，而并非是 OpenAI 上周公开发布的版本。负责 FrontierMath 的 Epoch 研究所于上周五公布了其对 o3 模型的独立基准测试结果，发现 o3 的得分仅为约 10%，远低于 OpenAI 此前声称的最高分数。

这并不意味着 OpenAI 故意撒谎，该公司在 12 月份公布的基准测试结果中也包含了一个与 Epoch 测试结果相符的较低分数。Epoch 还指出，其测试设置可能与 OpenAI 有所不同，并且其评估使用了更新版本的 FrontierMath。Epoch 在报告中写道：“我们与 OpenAI 的结果差异可能是因为 OpenAI 在内部评估时使用了更强大的计算框架、更多的测试时计算资源，或者是因为这些结果是在 FrontierMath 的不同子集上运行的（例如 2024 年 11 月 26 日版本的 180 个问题与 2025 年 2 月 28 日私有版本的 290 个问题）。”

此外，ARC Prize 基金会（一个测试了 o3 预发布版本的组织）在 X 平台上发布消息表示，公开发布的 o3 模型是一个“针对聊天 / 产品使用进行了调整的不同模型”，这进一步证实了 Epoch 的报告。ARC Prize 还指出：“所有发布的 o3 计算层级都比我们测试的版本要小。”一般来说，更大的计算层级通常可以获得更好的基准测试分数。

值得注意的是，尽管公开版本的 o3 未能完全达到 OpenAI 测试时的表现，但这在一定程度上已不再是关键问题，因为该公司后续推出的 o3-mini-high 和 o4-mini 模型在 FrontierMath 上的表现已经优于 o3。此外，OpenAI 计划在未来几周内推出更强大的 o3 版本 o3-pro。

然而，此事再次提醒人们，人工智能基准测试结果最好不要完全照单全收，尤其是当结果来自一家有产品需要销售的公司时。随着人工智能行业竞争的加剧，各供应商纷纷急于通过推出新模型来吸引眼球和市场份额，基准测试“争议”正变得越来越常见。

注意到，今年 1 月，Epoch 因在 OpenAI 宣布 o3 之后才披露其从 OpenAI 获得的资金支持而受到批评。许多为 FrontierMath 做出贡献的学者直到公开时才知道 OpenAI 的参与。最近，埃隆・马斯克的 xAI 被指控为其最新的人工智能模型 Grok 3 发布了误导性的基准测试图表。就在本月，Meta 也承认其宣传的基准测试分数所基于的模型版本与提供给开发者的版本不一致。

本文链接：http://www.28at.com/showinfo-45-12493-0.htmlOpenAI o3 模型基准测试成绩遭质疑，实测分数远不及宣称

声明：本网页内容旨在传播知识，若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。邮件：2376512515@qq.com

上一篇：天工机器人：人形机器人即将实现小批量量产，未来售价可与入门轿车相当

下一篇：湖北武汉警方查处一起利用 AI 编造网络谣言案件，涉事公司被行政警告

标签：

热门焦点

SQL Error: select * from ***_ecms_news13 where id in(71,219,121,150,81,,30,64,10) limit 9

首页

元宇宙

NFT

区块链

虚拟人

AR/VR

AI

元宇宙百科

OpenAI o3 模型基准测试成绩遭质疑，实测分数远不及宣称

最新推荐

“我没搞懂元宇宙，但一天能赚9w块”

Snoop Dogg 计划推出致力于数字媒体NFT的专业公司

头像类NFTs的统治能持续多久？

融资千万美元的元宇宙平台UGC到底是什么？

百度虚拟人——AI手语主播首次亮相冬奥会！

从NFT数字收藏，洞察数字音乐版权市场发展趋势

猜你喜欢

热门推荐

相关资讯