当前位置：首页 > 元宇宙 > AI

上海人工智能实验室发布首个 AI 高考评测结果：语数英总分最高 303 分，数学全部不及格

来源：责编：时间：2024-06-22 16:27:51 330观看

导读 6 月 20 日消息，上海人工智能实验室 19 日公布了首个 AI 高考全卷评测结果。据介绍，2024 年全国高考甫一结束，该实验室旗下司南评测体系 OpenCompass 选取 6 个开源模型及 GPT-4o 进行高考“语数外”全卷能力测

6 月 20 日消息，上海人工智能实验室 19 日公布了首个 AI 高考全卷评测结果。据介绍，2024 年全国高考甫一结束，该实验室旗下司南评测体系 OpenCompass 选取 6 个开源模型及 GPT-4o 进行高考“语数外”全卷能力测试。

评测采用全国新课标 I 卷，参与评测的所有开源模型开源时间均早于高考，确保评测“闭卷”性。同时，成绩由具有高考评卷经验的教师人工评判，更加接近真实阅卷标准。

该机构表示，Qwen2-72B、GPT-4o 及书生・浦语 2.0 文曲星（InternLM2-20B-WQX）成为本次大模型高考的前三甲，得分率均超过 70%。大部分模型“考生”语文、英语科目表现良好，但数学方面仍有很大提升空间。

具体来看，InternLM2-20B-WQX 取得了数学单科的最高分，超越包括 GPT-4o 在内的所有模型。

注：此次参与“大模型高考”评测的产品包含 GPT-4o 及其他 6 个模型。为公平起见，此次评测没有纳入商用闭源模型。

Mixtral 8x22B：法国 AI 创业公司 Mistral 于 2024 年 4 月 17 日开源的对话模型。

Yi-1.5-34B：零一万物公司于 2024 年 5 月 12 日开源的 Yi-1.5 系列最大的模型。

GLM-4-9B：智谱 AI 于 2024 年 6 月 4 日推出的最新一代预训练模型 GLM-4 系列的开源版本。

InternLM2-20B-WQX：上海人工智能实验室于 2024 年 6 月 4 日开源的书生・浦语 2.0 系列文曲星大语言模型。

Qwen2-57B：阿里巴巴于 2024 年 6 月 6 日开源的 Qwen2 系列 MoE 对话模型。

Qwen2-72B：阿里巴巴于 2024 年 6 月 6 日开源的 72B 稠密模型。

语数外三科加起来的满分为 420 分，此次高考测试结果显示，阿里通义千问 2-72B 排名第一，为 303 分，OpenAI 的 GPT-4o 排名第二，得分 296 分，上海人工智能实验室的书生・浦语 2.0 排名第三，三个大模型的得分率均超过 70%。来自法国大模型初创公司的 Mistral 排名末尾，仅拿下 185 分。

数学是所有大模型的短板，平均得分率仅有 36%，参与测试的大模型无一及格。

此外，阅卷教师也对大模型表现进行了整体分析，为模型能力提升策略提供参考。

语文

模型的现代文阅读理解能力普遍较强，但是不同模型的文言文阅读理解能力差距较大。

大模型作文更像问答题，虽然有针对性但缺乏修饰，几乎不存在人类考生都会使用举例论证、引用论证、名人名言和人物素材等手法。

多数模型无法理解“本体”“喻体”“暗喻”等语文概念。语言中的一些“潜台词”，大模型尚无法完全理解。

数学

大模型的主观题回答相对凌乱，且过程具有迷惑性，甚至出现过程错误但得到正确答案的情况。

大模型的公式记忆能力较强，但是无法在解题过程中灵活引用。

英语

英语整体表现良好，但部分模型由于不适应题型，在七选五、完形填空等题型得分率较低。

大模型英语作文普遍存在因超出字数限制而扣分的情况，而人类考生多因为字数不够扣分。

本文链接：http://www.28at.com/showinfo-45-4723-0.html上海人工智能实验室发布首个 AI 高考评测结果：语数英总分最高 303 分，数学全部不及格

声明：本网页内容旨在传播知识，若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。邮件：2376512515@qq.com

上一篇： B站开源轻量级 Index-1.9B 系列模型：2.8T 训练数据，支持角色扮演

下一篇：振兴乡村发展助力青少年教育中国三星连续十一年蝉联企业社会责任榜外企第一

标签：

热门焦点

内容行业大变天，爆款全靠AI？

出品 | 微果酱（wjam123456）作者 | 陈出木题图 | 文心一格 AI的发展之快出乎所有人的预料，似乎一夜之间便呼啸而来。无论是资本的风向标，抑或是生活工作的辅助、流量口，还是茶余饭
数字人的新革命，BAT的“冲高”战场

来源：刘旷ChatGPT横空出世，让人们看到了数字人的另一种可能，将ChatGPT与虚拟数字人融合，研发出更加智能化、拟人化的虚拟数字人成为数字人厂商的新命题、新方向。2月份，岭南股份
汽车元宇宙，是概念还是未来？

作者｜何文元宇宙是未来趋势已经无需验证。从概念上来看，元宇宙是两种存在多年的概念的融合：虚拟现实和数字第二人生。这也就意味着，元宇宙所代表的是一种新的数
刷完一场元宇宙世界杯音乐盛典，我爽了

作者|刘小土编辑|李春晖你有多久没完整追过一场音乐盛典了？三刷都不嫌多的那种。按照惯例，每逢年底，直播、长短视频、音乐平台便会抢着端上来几场音乐盛典。搁以
一个视频涨粉百万，柳夜熙们能成为元宇宙的“船票”吗？

当数字人成为一种生意，我们更关心的是，他们如何赚到钱，以及这意味着什么？01#“柳夜熙”爆火之后不知道大家还记不记得，去年10月31日万圣节，有一位虚拟美妆
Interface正大光明的“跑路”，社区成员赞格局大

今日凌晨，一个广泛受社区期待的潜力蓝筹项目Interfaces突然发文宣布项目停止运营，后续也不会有铸造NFT系列的活动。这对社区来说就是一重磅炸弹，大多数人完全不明
新闻业在元宇宙的现状和未来

“美联社有毛病吧，这真的过分了！”，一位媒体编辑在推特中愤怒地表示。这是针对一款视频NFT的批评言论之一，之后取消了此次销售，因为该视频呈现了移民穿越地中海的苦
大厂打造元宇宙平台的业务重心是什么？

知名市场研究机构IDC发布《2022年中国元宇宙市场十大预测》报告，其中提出互联网大厂各自独立布局元宇宙平台。事实上，在2021年的最后一个季度，包括Meta、英伟达、
超级账本Julian Gordon：联盟链与公链的竞争不是非此即彼

在2021年《福布斯》区块链50强榜单中，29家企业使用Hyperledger超级账本技术，占比近60%。同年，研究机构Blockdata发布了的调查报告显示，访问Top100上市公司中，有 81

首页

元宇宙

NFT

区块链

虚拟人

AR/VR

AI

元宇宙百科

上海人工智能实验室发布首个 AI 高考评测结果：语数英总分最高 303 分，数学全部不及格

内容行业大变天，爆款全靠AI？

数字人的新革命，BAT的“冲高”战场

汽车元宇宙，是概念还是未来？

刷完一场元宇宙世界杯音乐盛典，我爽了

一个视频涨粉百万，柳夜熙们能成为元宇宙的“船票”吗？

Interface正大光明的“跑路”，社区成员赞格局大

新闻业在元宇宙的现状和未来

大厂打造元宇宙平台的业务重心是什么？

超级账本Julian Gordon：联盟链与公链的竞争不是非此即彼

最新推荐

不同于传统数字经济，元宇宙赋予商业生态更多数字资产价值！

元宇宙步入暗夜

2022 区块链 50 强榜单；垃圾NFT项目的十三个特性

本周NFT领域重要资讯回顾

费城艺术家使用区块链，在数字艺术中狠狠捞一笔

技术赋能，国内首家宠物元宇宙平台“Pet Meta”开启虚拟养宠新方式

猜你喜欢

热门推荐

相关资讯