当前位置:首页 > 元宇宙 > AI

从 DeepSeek 火热,到李飞飞团队新成果,“幕后高手”竟是它

来源: 责编: 时间:2025-02-08 12:16:04 187观看
导读 最近 AI 大模型领域可以说是热点话题不断,DeepSeek 的热潮还未消退,国内李飞飞团队提出的一种模型训练新方法又在行业里引发热议。具体来说,他们以阿里云通义千问 Qwen2.5-32B-Instruct 开源模型为底座,在 16 块

最近 AI 大模型领域可以说是热点话题不断,DeepSeek 的热潮还未消退,国内李飞飞团队提出的一种模型训练新方法又在行业里引发热议。HQJ28资讯网——每日最新资讯28at.com

具体来说,他们以阿里云通义千问 Qwen2.5-32B-Instruct 开源模型为底座,在 16 块 H100 GPU 上进行监督微调,仅用时 26 分钟便训练出了新模型 s1-32B。令人惊叹的是,该模型在数学及编码能力上取得了与 OpenAI 的 o1 和 DeepSeek 的 R1 等尖端推理模型相当的效果,甚至在竞赛数学问题上的表现比 o1-preview 高出 27%。HQJ28资讯网——每日最新资讯28at.com

HQJ28资讯网——每日最新资讯28at.com

同时值得关注的是,DeepSeek 早在之前也曾透露,将 DeepSeek-R1 的推理能力蒸馏 6 个模型开源给社区,其中 4 个模型正是基于 Qwen 开发的。基于 Qwen-32B 蒸馏的模型,在多项能力上实现了对标 OpenAI o1-mini 的效果。HQJ28资讯网——每日最新资讯28at.com

HQJ28资讯网——每日最新资讯28at.com

这表明,Qwen 模型不仅能够满足顶尖团队对模型性能的高要求,还能为不同团队提供多样化的开发路径,助力他们在各自的研究方向上取得突破。HQJ28资讯网——每日最新资讯28at.com

一时间,在开源社区备受追捧的通义千问 Qwen 模型,因这一轮推理模型技术新浪潮又一次成为大家关注的焦点。HQJ28资讯网——每日最新资讯28at.com

李飞飞团队与 DeepSeek 纷纷选择 Qwen 作为基座模型,已经足以引发业界的关注和广泛讨论,而这一现象背后,不仅是 Qwen 模型自身强大的性能与独特优势的体现,更是开源理念推动技术进步的生动案例。HQJ28资讯网——每日最新资讯28at.com

那么 Qwen 模型究竟强在哪里?又为什么如此受到热捧呢?认为主要有以下几点原因。HQJ28资讯网——每日最新资讯28at.com

首先,是阿里云 Qwen 模型具有强劲的性能优势。HQJ28资讯网——每日最新资讯28at.com

据了解,阿里云通义千问 Qwen 模型自 2023 年 8 月起相继开源了 Qwen、Qwen1.5、Qwen2、Qwen2.5 等 4 代模型,涵盖了大语言模型、多模态模型、数学模型和代码模型等数十款。这些模型在全球多个权威榜单上屡次斩获“全球开源冠军”,性能全球领先。HQJ28资讯网——每日最新资讯28at.com

例如,在 HuggingFace 的 Open LLM Leaderboard、Chatbot Arena 大模型盲测榜单、司南 OpenCompass 等多个国内外知名榜单上,Qwen 模型都展现出了卓越的实力。其强大的性能为开发者提供了坚实的基础,使得基于 Qwen 开发的模型能够在各种应用场景中表现出色。HQJ28资讯网——每日最新资讯28at.com

除了强劲的性能,Qwen 模型的开源策略也是是其受到广泛欢迎的重要原因之一。HQJ28资讯网——每日最新资讯28at.com

要知道,阿里云率先实现了“全尺寸、全模态、多场景”的开源,从 1.5B 到 72B 乃至 110B,Qwen 开源的模型尺寸及版本覆盖面最广。这种多样化的选择为开发者和企业提供了极大的便利,无论是小型项目还是大规模应用,都能找到适合的 Qwen 模型版本。2024 年,仅 Qwen2.5-1.5B-Instruct 这款模型,就占到了全球模型下载量的 26.6%,远高于第二名 Llama-3.1-8B-Instruct-GGUF 的 6.44%。同时仅视觉理解 Qwen-VL 及 Qwen2-VL 两款模型,全球下载量就突破 3200 万次,一周前,Qwen2.5-VL 全新升级,又引发新一轮开源社区狂热。这充分说明了 Qwen 模型在开源社区中的受欢迎程度。HQJ28资讯网——每日最新资讯28at.com

HQJ28资讯网——每日最新资讯28at.com

第三点,Qwen 模型的火热还得益于其庞大的衍生模型群。HQJ28资讯网——每日最新资讯28at.com

截至目前,海内外开源社区中 Qwen 的衍生模型数量已突破 9 万,超越了 Llama 系列衍生模型,成为世界最大的生成式语言模型族群。这一庞大的衍生模型群不仅体现了 Qwen 模型的广泛影响力,也反映了其在技术上的可扩展性和适应性。全球 AI 模型开发者都可以基于 Qwen 进行不同技术的差异化比较,从而进一步推动了 Qwen 的火热。这种开源生态的繁荣,使得 Qwen 成为了开源社区事实上最重要的标杆基座模型。HQJ28资讯网——每日最新资讯28at.com

通过以上三点的分析,我们其实已经可以得出结论:Qwen 模型性能强劲,开源尺寸多样化,并且拥有全球最大的衍生模型群,已经取代 Llama 成为开源社区事实上最重要的标杆基座模型。HQJ28资讯网——每日最新资讯28at.com

总之,阿里云通义千问 Qwen 模型因其强劲的性能、开源与尺寸多样化以及庞大的衍生模型群等优势,成为了李飞飞团队和 DeepSeek 的共同选择。这不仅展示了 Qwen 模型在人工智能领域的卓越实力,也体现了开源理念在推动技术创新、促进开源生态建设和助力行业应用落地等方面的重要价值。随着人工智能技术的不断发展,我们有理由相信,Qwen 模型将继续引领开源潮流,为全球人工智能的发展贡献更多力量。HQJ28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-45-10553-0.html从 DeepSeek 火热,到李飞飞团队新成果,“幕后高手”竟是它

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 斥 300 亿-500 亿美元巨资,法国、阿联酋将共建 AI 专用数据中心

下一篇: 受谷歌 750 亿美元 AI 投资提振,英伟达股价一度涨超 5%

标签:
  • 热门焦点
  • 沉寂3年,大模型激活小度天猫精灵?

    Tech星球(微信ID:tech618)文 | 何煦阳 沉寂了许久的智能音箱,在今年大模型横空出世之后,又再次燃起了新的希望。 2月9日,小度宣布将融合文心一言,打造针对智能设备场景的AI模型&ldq
  • 抢先推出“元宇宙”饮料,可口可乐赢麻了

    试图傍上元宇宙的品牌千千万,但像可口可乐玩得这么花的,属实不多。01 可口可乐盯上元宇宙1886年,可口可乐诞生于美国乔治亚州亚特兰大市,至今已拥有136年的悠久历
  • 一个视频涨粉百万,柳夜熙们能成为元宇宙的“船票”吗?

    当数字人成为一种生意,我们更关心的是,他们如何赚到钱,以及这意味着什么?01#“柳夜熙”爆火之后不知道大家还记不记得,去年10月31日万圣节,有一位虚拟美妆
  • 元宇宙火热的当下,我们该如何“身临其境”的体验元宇宙?

    元宇宙的余热依然没有过去,甚至大有星星之火开启燎原之势,元宇宙本身也从殿堂走向了民间,我们可以看到一些企业开始了元宇宙的探索,诸如中国电信全资控股子公司天
  • 元宇宙“概念股”集体崩塌,背后究竟发生了什么?

    近期,Roblox和Meta公布了第四季度的财务报告,在财报发布一日后,股价大跌。作为市值一度超过1万亿美元的世界第六大公司Meta,股价大跌4%,市值降至5650亿美元,甚至跌出
  • 数字经济、数据要素与数字治理

    深入理解数字经济与数据要素,有利于更准确理解和把握数字治理的基本规律,构建面向未来的健康的数字治理体系,也才能更好地理解元宇宙的治理框架。 一、数字经济
  • a16z:元宇宙办公会取代实体办公室吗?

    6位不同的专家对未来的工作发表看法----元宇宙--沉浸式的、基于区块链的虚拟世界,大多数日常活动最终会在这里发生--但仍然只是一个概念。但它是一个拥有宝贵不
  • 顶级NFT收藏家Gary Vaynerchuk 与百威推出NFT

    特别声明,我们的文章不作为投资建议,请各位读者独立思考,还是那句话:投资要慎之又慎,谁也不要相信。Gary Verneychuk 和百威 NFT 之一。由 VeynerNFT 提供百威推出
  • 全球十大元宇宙概念游戏

    A股市场中,不少游戏公司早早搭上了元宇宙概念。举例,中青宝宣称将发布一款元宇宙概念的模拟经营类游戏,尽管游戏尚在研发中,这一消息已经让中青宝的股价在51个交易
Top