当前位置:首页 > 元宇宙 > AI

阿里通义深夜炸场:全球首个端到端全模态 AI 模型 Qwen3-Omni 发布开源,文本、图像、音视频全统一

来源: 责编: 时间:2025-09-25 15:00:01 148观看
导读 9 月 23 日消息,又是熟悉的深夜,阿里云今日发布并开源了全新的 Qwen3-Omni、Qwen3-TTS,以及对标谷歌 Nano Banana 图像编辑工具的 Qwen-Image-Edit-2509。Qwen3-Omni 是业界首个原生端到端全模态 AI 模型,能够处

9 月 23 日消息,又是熟悉的深夜,阿里云今日发布并开源了全新的 Qwen3-Omni、Qwen3-TTS,以及对标谷歌 Nano Banana 图像编辑工具的 Qwen-Image-Edit-2509。ZOa28资讯网——每日最新资讯28at.com

Qwen3-Omni 是业界首个原生端到端全模态 AI 模型,能够处理文本、图像、音频和视频多种类型的输入,并可通过文本与自然语音实时流式输出结果,解决了长期以来多模态模型需要在不同能力之间进行权衡取舍的难题。ZOa28资讯网——每日最新资讯28at.com

ZOa28资讯网——每日最新资讯28at.com

Qwen3-Omni 是原生端到端的多语言全模态基础模型,其核心特性主要包括:ZOa28资讯网——每日最新资讯28at.com

跨模态最先进表现:通过早期以文本为核心的预训练和混合多模态训练,模型具备原生多模态能力。在实现强大音频与音视频性能的同时,单模态的文本与图像效果保持不降。在 36 项音频 / 视频基准测试中,22 项达到了最新水平,其中 32 项在开源范围内处于领先;在自动语音识别(ASR)、音频理解与语音对话方面表现可与 Gemini 2.5 Pro 相当。ZOa28资讯网——每日最新资讯28at.com

多语言:支持 119 种文本语言、19 种语音输入语言以及 10 种语音输出语言。ZOa28资讯网——每日最新资讯28at.com

语音输入语言:英语、中文、韩语、日语、德语、俄语、意大利语、法语、西班牙语、葡萄牙语、马来语、荷兰语、印尼语、土耳其语、越南语、粤语、阿拉伯语、乌尔都语。ZOa28资讯网——每日最新资讯28at.com

语音输出语言:英语、中文、法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语、韩语。ZOa28资讯网——每日最新资讯28at.com

创新架构:基于 MoE(专家混合)的“思考者–表达者”设计,并结合 AuT 预训练以获得强大的通用表征能力,同时采用多码本设计以将延迟降至最低。ZOa28资讯网——每日最新资讯28at.com

实时音频 / 视频交互:低延迟流式交互,支持自然的轮流对话和即时的文本或语音响应。ZOa28资讯网——每日最新资讯28at.com

灵活控制:可通过系统提示词自定义行为,实现细粒度控制与轻松适配。ZOa28资讯网——每日最新资讯28at.com

精细音频描述: Qwen3-Omni-30B-A3B-Captioner 已开源,这是一个通用型、细节丰富、低幻觉率的音频描述模型,填补了开源社区在该领域的空白。ZOa28资讯网——每日最新资讯28at.com

ZOa28资讯网——每日最新资讯28at.com

附官方地址:ZOa28资讯网——每日最新资讯28at.com

GitHub:https://github.com/QwenLM/Qwen3-OmniZOa28资讯网——每日最新资讯28at.com

抱抱脸:https://huggingface.co/collections/Qwen/qwen3-omni-68d100a86cd0906843ceccbeZOa28资讯网——每日最新资讯28at.com

魔搭:https://modelscope.cn/collections/Qwen3-Omni-867aef131e7d4fZOa28资讯网——每日最新资讯28at.com

Demo:https://huggingface.co/spaces/Qwen/Qwen3-Omni-DemoZOa28资讯网——每日最新资讯28at.com

ZOa28资讯网——每日最新资讯28at.com

TTS 即文本转语音,阿里云此次发布的 TTS 支持 17 种音色选择,每一种音色均支持 10 种语言。其中不仅包含多国语言,有:普通话、英语、法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语、韩语;还支持了更多中国方言:闽南语、吴语、粤语、四川话、北京话、南京话、天津话和陕西话。ZOa28资讯网——每日最新资讯28at.com

ZOa28资讯网——每日最新资讯28at.com

ZOa28资讯网——每日最新资讯28at.com

此外,Qwen3-TTS-Flash 在多项评估基准上均取得了 SoTA 的表现,超越 SeedTTS、MiniMax、GPT-4o-Audio-Preview、Elevenlabs,特别是在语音稳定性和音色相似度。ZOa28资讯网——每日最新资讯28at.com

延迟对比Qwen3-TTS-FlashQwen-TTS并发数双卡 12 并发双卡 6 并发首包延迟(单并发)97ms200ms首包延迟(满并发)420ms733ms首包大小(满并发且越大越好)320ms190msRTF(单并发)0.300.43RTF(满并发)0.510.72

官方地址:ZOa28资讯网——每日最新资讯28at.com

Demo:https://huggingface.co/spaces/Qwen/Qwen3-TTS-DemoZOa28资讯网——每日最新资讯28at.com

博客:https://qwen.ai/blog?id=b4264e11fb80b5e37350790121baf0a0f10daf82&from=research.latest-advancements-listZOa28资讯网——每日最新资讯28at.com

ZOa28资讯网——每日最新资讯28at.com

Qwen-Image-Edit-2509 是 Qwen-Image 月度迭代升级版本,和字节前几天发布的即梦 4.0 图像模型一样主要是一致性上巨大提升。ZOa28资讯网——每日最新资讯28at.com

与 8 月份发布的 Qwen-Image-Edit 相比,Qwen-Image-Edit-2509 的主要改进包括:ZOa28资讯网——每日最新资讯28at.com

多图像编辑支持:对于多图像输入,Qwen-Image-Edit-2509 基于 Qwen-Image-Edit 架构,并通过图像拼接进一步训练,以实现多图像编辑。它支持各种组合,如“人 + 人”、“人 + 产品”和“人 + 场景”。目前在 1 到 3 张输入图像时表现最佳。ZOa28资讯网——每日最新资讯28at.com

增强的单图像一致性:对于单图像输入,Qwen-Image-Edit-2509 显著提高了编辑的一致性,特别是在以下方面:ZOa28资讯网——每日最新资讯28at.com

改进的人像编辑一致性:更好地保留面部身份,支持各种肖像风格和姿势变换;ZOa28资讯网——每日最新资讯28at.com

改进的产品编辑一致性:更好地保留产品身份,支持产品海报编辑;ZOa28资讯网——每日最新资讯28at.com

改进的文字编辑一致性:除了修改文字内容外,还支持编辑文字字体、颜色和材质;ZOa28资讯网——每日最新资讯28at.com

原生支持 ControlNet:包括深度图、边缘图、关键点图等。ZOa28资讯网——每日最新资讯28at.com

ZOa28资讯网——每日最新资讯28at.com

官方地址:ZOa28资讯网——每日最新资讯28at.com

博客:https://qwen.ai/blog?id=7a90090115ee193ce6a7f619522771dd9696dd93&from=research.latest-advancements-listZOa28资讯网——每日最新资讯28at.com

魔搭:https://modelscope.cn/models/Qwen/Qwen-Image-Edit-2509ZOa28资讯网——每日最新资讯28at.com

抱抱脸:https://huggingface.co/Qwen/Qwen-Image-Edit-2509ZOa28资讯网——每日最新资讯28at.com

GitHub:https://github.com/QwenLM/Qwen-ImageZOa28资讯网——每日最新资讯28at.com

另外,Qwen3-Next-80B-A3B-Instruct-FP8 和 Qwen3-Next-80B-A3B-Thinking-FP8 也已经开源:ZOa28资讯网——每日最新资讯28at.com

抱抱脸:https://huggingface.co/collections/Qwen/qwen3-next-68c25fd6838e585db8eeea9dZOa28资讯网——每日最新资讯28at.com

魔搭:https://modelscope.cn/collections/Qwen3-Next-c314f23bd0264aZOa28资讯网——每日最新资讯28at.com

相关阅读:ZOa28资讯网——每日最新资讯28at.com

《阿里云发布通义 Qwen3-Next 基础模型架构并开源 80B-A3B 系列:改进混合注意力机制、高稀疏度 MoE 结构》ZOa28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-45-28054-0.html阿里通义深夜炸场:全球首个端到端全模态 AI 模型 Qwen3-Omni 发布开源,文本、图像、音视频全统一

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 华为&中国信通院联合解析:超节点如何破解AI算力瓶颈并引领未来趋势

下一篇: 提升团队执行力:微软 Teams 公测 Channel Agent,AI 生成报告、追踪任务

标签:
  • 热门焦点
  • 一份全面清单:Web3行业高薪酬的13种工作

    来源:区块链骑士这可能会让许多人感到震惊,但除了成为开发人员之外,Web3还有其他高薪工作。Web3可能是现代就业市场中跨学科最多的领域,换句话说,它由许多个在不同领域中具有不同
  • AI大模型“战火”烧到了教育领域

    作者:刘旷自2023年开年以来,AI大模型这股风是越吹越猛烈了。随着ChatGPT的出圈爆火,再度掀起了一波AI热浪,无论是在国内还是国外都有不少企业宣布入局或者跟进AI大模型领域。与
  • 传腾讯已推出全新XR业务;摩托罗拉正打造5GXR颈戴式计算组件

    今日热点:传腾讯已推出全新XR业务;摩托罗拉与Verizon合作打造5G XR颈戴式计算组件;小米AR购物导航专利获授权;VR一体机Simula One放弃众筹并开放直接预订;VR游戏《
  • 小众有趣NFT艺术作品欣赏(1)

    随着NFT发展火热,越来越多领域与NFT融合,NFT艺术在加密领域中占据了很大一部分。NFT艺术与传统艺术有相似之处,也有完全不同的地方。NFT艺术与传统艺术一样,表现了
  • 元宇宙风归何处?

    元宇宙持续大火,在过去一段时间内,其屡次登上热点,吸引了一波又一波投资者。近期,在“2022中国·金鱼嘴元宇宙生态赋能大会”上,南京建邺区金鱼嘴基金街区宣布计划
  • 艺术创作者能否永久收取版税?

    NFTs正在改变我们理解互联网所有权的方式,社区管理的所有权有很多好处,但如果创作者想为他/她的创作获得永久的收益(版税),会发生什么?这不是一个容易解决的问题,版税
  • NFT高玩必备:NFT分析工具大盘点

    NFT市场的火热让越来越多的投资者投身其中,但当前的 NFT 生态系统存在几个问题却困扰了大多数人,如难以准确评估 NFT 项目的资产价格、缺乏 NFT 市场动态信息、
  • 知名艺术家打造去中心化“好莱坞”:一部电影一个DAO

    根据市场追踪网站 DappRadar 的数据,随着 NFT 的“出圈”与加密货币的普及,NFT 市场在 2021 年的销售额达到约 250 亿美元,而 2020 年仅为 9490 万美元,同比增超 2
  • 爆发在即的Layer2赛道百花齐放,谁将是领跑者?

    还记得几年前最早我们提起ETH扩容,首先想到就是Layer2,而Layer2里,首先想到的是闪电网络,状态通道,Plasma…然后折腾了几年,发现并没有什么用,许多项目方和资本也等不
Top