当前位置:首页 > 科技  > 芯片

小米首次曝光AI大模型MiLM-6B,评测榜单排名第十

来源: 责编: 时间:2023-08-14 22:01:40 316观看
导读电子工程专辑讯此前小米公布2023Q1财报时,卢伟冰曾指出,小米不会像OpenAI公司那样去做通用大模型,会跟公司的业务相结合,通过技术转化为业务成果。小米对AI大模型的态度也是持开放状态,有可能引进第三方来帮助发展。近日,小

电子工程专辑讯此前小米公布2023Q1财报时,卢伟冰曾指出,小米不会像OpenAI公司那样去做通用大模型,会跟公司的业务相结合,通过技术转化为业务成果。小米对AI大模型的态度也是持开放状态,有可能引进第三方来帮助发展。n5k28资讯网——每日最新资讯28at.com


近日,小米来自大模型评测平台的C-Eval、CMMLU的数据评分被曝光,引发谈论。AI概念这段时间的“风声”很大,小米偷偷发力AI大模型的进展到什么程度了?n5k28资讯网——每日最新资讯28at.com


小米在Github是这样介绍MiLM-6B:MiLM-6B是由小米开发的一个大规模预训练语言模型,参数规模为64亿。在C-Eval和CMMLU上均取得同尺寸最好的效果。n5k28资讯网——每日最新资讯28at.com


在得分方面,在C-Eval评估中,MiLM-6B的平均分为60.2,总榜单排名第10、同参数量级排名第1。在CMMLU评估中,MiLM-6B在Five-shot和Zero-shot测试中的平均分分别为57.17和60.37。n5k28资讯网——每日最新资讯28at.com


根据C-Eval给出的信息,MiLM-6B模型在具体各科目成绩上,在STEM(科学、技术、工程和数学教育)全部20个科目中,计量师、物理、化学、生物等多个项目获得了较高的准确率。不过在“法学、数学、编程、概率论、离散数学”等涉及“抽象思维”的科目中,还有一定进步空间。在人文科学的11个科目中,MiLM-6B则在“历史与法律”基础上有着不错的准确率表现。n5k28资讯网——每日最新资讯28at.com


n5k28资讯网——每日最新资讯28at.com


“CMMLU”是一个综合性的中文评估基准,专门用于评估语言模型在中文语境下的知识和推理能力。CMMLU涵盖了从基础学科到高级专业水平的67个主题。它包括:需要计算和推理的自然科学,需要知识的人文科学和社会科学,以及需要生活常识的中国驾驶规则等。此外,CMMLU中的许多任务具有中国特定的答案,可能在其他地区或语言中并不普遍适用。因此是一个完全中国化的中文测试基准。n5k28资讯网——每日最新资讯28at.com


“C-Eval”是由上海交通大学、清华大学、爱丁堡大学共同构建的一个针对基础模型的综合中文评估套件。它由13948道多项选择题组成,涵盖52个不同学科和四个难度级别,覆盖人文、社科、理工,及其他专业四个大方向,用以帮助中文社区研发大模型。n5k28资讯网——每日最新资讯28at.com


据悉,目前小米在大模型团队方面的主力团队有30多人,按照人才、数据、模型、算力、评测、产品这几个方面进行筹备,不会扩张的太快。小米把“AI实验室”比喻成集团层面AI技术的“试验田”和“弹药库”,如果AI发展迅速,AI实验室会研发一些中长期的前沿技术,围绕小米业务做储备,在集团需要的时候输出“弹药”。n5k28资讯网——每日最新资讯28at.com


AI的发展速度究竟会有多快或者多慢,其实很难评判。就比如OpenAI推出的ChatGPT,一夜之间就让沉淀的AI技术发生井喷式发展,但现在AI技术还在找一个能真正落地的应用场景。小米的大模型也将在未来丰富其业务发展,比如小米的小爱同学、手机操作系统MIUI、汽车的座舱、IoT、机器人,都是应用大模型的典型场景。n5k28资讯网——每日最新资讯28at.com


而且小米现在研发的AI大模型也是有侧重点的,更多侧重在语言大模型上,去丰富提升小爱同学的理解能力、智能家居指令的识别能力等。至于通过大模型来实现智能家居的自动组网、个性化的家居体验,至少小米AI实验室没有在做。n5k28资讯网——每日最新资讯28at.com


责编:Amy.wu
<

本文链接:http://www.28at.com/showinfo-27-5635-0.html小米首次曝光AI大模型MiLM-6B,评测榜单排名第十

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 伸缩滑轨于工业自动化中如何提高生产系统的性能

下一篇: 三星电子预告256TB SSD:基于 3D QLC

标签:
  • 热门焦点
  • 十个可以手动编写的 JavaScript 数组 API

    JavaScript 中有很多API,使用得当,会很方便,省力不少。 你知道它的原理吗? 今天这篇文章,我们将对它们进行一次小总结。现在开始吧。1.forEach()forEach()用于遍历数组接收一参
  • CSS单标签实现转转logo

    转转品牌升级后更新了全新的Logo,今天我们用纯CSS来实现转转的新Logo,为了有一定的挑战性,这里我们只使用一个标签实现,将最大化的使用CSS能力完成Logo的绘制与动画效果。新logo
  • Golang 中的 io 包详解:组合接口

    io.ReadWriter// ReadWriter is the interface that groups the basic Read and Write methods.type ReadWriter interface { Reader Writer}是对Reader和Writer接口的组合,
  • 如何正确使用:Has和:Nth-Last-Child

    我们可以用CSS检查,以了解一组元素的数量是否小于或等于一个数字。例如,一个拥有三个或更多子项的grid。你可能会想,为什么需要这样做呢?在某些情况下,一个组件或一个布局可能会
  • 谷歌KDD'23工作:如何提升推荐系统Ranking模型训练稳定性

    谷歌在KDD 2023发表了一篇工作,探索了推荐系统ranking模型的训练稳定性问题,分析了造成训练稳定性存在问题的潜在原因,以及现有的一些提升模型稳定性方法的不足,并提出了一种新
  • 新电商三兄弟,“抖快红”成团!

    来源:价值研究所作 者:Hernanderz 随着内容电商的概念兴起,抖音、快手、小红书组成的&ldquo;新电商三兄弟&rdquo;成为业内一股不可忽视的势力,给阿里、京东、拼多多带去了巨大压
  • ESG的面子与里子

    来源 | 光子星球撰文 | 吴坤谚编辑 | 吴先之三伏大幕拉起,各地高温预警不绝,但处于厄尔尼诺大&ldquo;烤&rdquo;之下的除了众生,还有各大企业发布的ESG报告。ESG是&ldquo;环境保
  • 阿里大调整

    来源:产品刘有媒体报道称,近期淘宝天猫集团启动了近年来最大的人力制度改革,涉及员工绩效、层级体系等多个核心事项,目前已形成一个初步的&ldquo;征求意见版&rdquo;:1、取消P序列
  • 回归OPPO两年,一加赢了销量,输了品牌

    成为OPPO旗下主打性能的先锋品牌后,一加屡创佳绩。今年618期间,一加手机全渠道销量同比增长362%,凭借一加 11、一加 Ace 2、一加 Ace 2V三款爆品,一加
Top