当前位置:首页 > 游戏 > 单机

首个Al高考全卷评测结果发布 数学全部不及格

来源: 责编: 时间:2024-06-20 15:16:36 69观看
导读 高考结束后,上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。6月19日,OpenCompass发布了首个大模型高考全卷评测结果。在满分420分的三科测试中,阿里

高考结束后,上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。6月19日,OpenCompass发布了首个大模型高考全卷评测结果。7oP28资讯网——每日最新资讯28at.com

在满分420分的三科测试中,阿里通义千问2-72B以303分的成绩拔得头筹,紧随其后的是OpenAI的GPT-4o,获得296分,而上海人工智能实验室的书生·浦语2.0位列第三。7oP28资讯网——每日最新资讯28at.com

游民星空7oP28资讯网——每日最新资讯28at.com

这三大模型的得分率均超过了70%,展现了不俗的实力。相比之下,来自法国大模型初创公司的Mistral则排名末尾。7oP28资讯网——每日最新资讯28at.com

参与此次评测的模型来源广泛,包括阿里巴巴、零一万物、智谱AI、上海人工智能实验室、法国Mistral的开源模型,以及OpenAI的闭源模型GPT-4o。7oP28资讯网——每日最新资讯28at.com

游民星空7oP28资讯网——每日最新资讯28at.com

为确保公平,实验室特别指出,由于无法确定闭源模型的更新时间,评测中仅将GPT-4o作为参考,并未纳入商用闭源模型。同时,所有参与评测的模型均在高考前(2024年4月-6月)开源,有效避免了“刷题风险”。7oP28资讯网——每日最新资讯28at.com

从评测结果来看,大模型在语文和英语方面的表现普遍较好,但在数学方面则普遍不及格。最高分仅为75分,由书生·浦语2.0获得,紧随其后的是GPT-4o的73分。语文方面,通义千问表现出色,而英语则由GPT-4o领跑。7oP28资讯网——每日最新资讯28at.com

数学成绩的不理想凸显出大模型在复杂推理能力方面的不足。这一能力是金融、工业等要求可靠场景落地所需的关键能力,也是大模型未来发展的重要方向。7oP28资讯网——每日最新资讯28at.com

游民星空7oP28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-56-20661-0.html首个Al高考全卷评测结果发布 数学全部不及格

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 《塞尔达传说》新作截图、背景介绍:林克下落不明!

下一篇: 《皮皮鲁》动画电影立项!童话大王郑渊洁之子担任编剧

标签:
  • 热门焦点
Top