当前位置:首页 > 科技  > 互联网

Token-Shuffle突破!自回归模型也能高效生成高清图像

来源: 责编: 时间:2025-04-27 07:05:24 205观看
导读近日,科技新闻界传来一则关于meta AI创新进展的报道。据报道,meta AI研发了一种名为Token-Shuffle的新方法,旨在解决自回归(AR)模型在生成高分辨率图像时所面临的挑战。自回归模型是一种在时间序列分析中广泛应用的统计方

近日,科技新闻界传来一则关于meta AI创新进展的报道。据报道,meta AI研发了一种名为Token-Shuffle的新方法,旨在解决自回归(AR)模型在生成高分辨率图像时所面临的挑战。mRO28资讯网——每日最新资讯28at.com

自回归模型是一种在时间序列分析中广泛应用的统计方法,它基于历史数据预测未来值。近年来,这种方法在语言生成领域取得了显著成就,并逐渐应用于图像合成。然而,在处理高分辨率图像时,AR模型遇到了瓶颈。与文本生成相比,图像合成需要处理数千个token,导致计算成本急剧增加,限制了AR模型在精细图像生成中的应用。mRO28资讯网——每日最新资讯28at.com

尽管扩散模型在高分辨率图像生成方面表现出色,但其复杂的采样过程和较慢的推理速度也成为其应用的局限。因此,meta AI推出的Token-Shuffle方法显得尤为重要。mRO28资讯网——每日最新资讯28at.com

Token-Shuffle的核心机制在于解决token效率问题。该方法通过识别多模态大语言模型(MLLMs)中视觉词汇的维度冗余,提出了一种创新策略:在Transformer处理前,将空间上相邻的视觉token沿通道维度合并,推理后再恢复原始空间结构。这种token融合机制不仅降低了计算成本,还保持了视觉质量,使自回归模型能够高效处理最高达2048×2048分辨率的图像。mRO28资讯网——每日最新资讯28at.com

具体来说,Token-Shuffle包括两个关键步骤:token-shuffle和token-unshuffle。在输入准备阶段,通过多层感知机(MLP)将空间相邻的token压缩为单个token,从而减少token数量。以窗口大小s为例,token数量可减少到原来的s²分之一,显著降低了Transformer的计算量。mRO28资讯网——每日最新资讯28at.com

Token-Shuffle还引入了针对自回归生成的classifier-free guidance(CFG)调度器,动态调整引导强度,优化文本-图像对齐效果。这一创新不仅提升了图像生成的质量,还为AR模型在高分辨率图像生成领域树立了新的标杆。mRO28资讯网——每日最新资讯28at.com

在实验中,Token-Shuffle展现了强大的实力。在GenAI-Bench基准测试中,基于2.7B参数的LLaMA模型,Token-Shuffle在“困难”提示下取得了VQAScore 0.77,超越了其他AR模型如LlamaGen和扩散模型LDM。同时,在Geneval基准测试中,Token-Shuffle的综合得分为0.62,为AR模型树立了新的标准。mRO28资讯网——每日最新资讯28at.com

mRO28资讯网——每日最新资讯28at.com

用户评估也显示,尽管在逻辑一致性方面略逊于扩散模型,但Token-Shuffle在文本对齐和图像质量上优于LlamaGen和Lumina-mGPT。这一成果不仅为图像合成领域带来了新的突破,也为未来AR模型在更高分辨率图像生成中的应用提供了可能。mRO28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-21-147624-0.htmlToken-Shuffle突破!自回归模型也能高效生成高清图像

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 《逆转裁判》险成遗珠?前卡普空开发者谈新IP生存难

下一篇: AI伪造“非遗传承”骗局,“苗古金贴”高价售低质品被查!

标签:
  • 热门焦点
  • 如何正确使用:Has和:Nth-Last-Child

    我们可以用CSS检查,以了解一组元素的数量是否小于或等于一个数字。例如,一个拥有三个或更多子项的grid。你可能会想,为什么需要这样做呢?在某些情况下,一个组件或一个布局可能会
  • 一篇聊聊Go错误封装机制

    %w 是用于错误包装(Error Wrapping)的格式化动词。它是用于 fmt.Errorf 和 fmt.Sprintf 函数中的一个特殊格式化动词,用于将一个错误(或其他可打印的值)包装在一个新的错误中。使
  • 多线程开发带来的问题与解决方法

    使用多线程主要会带来以下几个问题:(一)线程安全问题  线程安全问题指的是在某一线程从开始访问到结束访问某一数据期间,该数据被其他的线程所修改,那么对于当前线程而言,该线程
  • JavaScript学习 -AES加密算法

    引言在当今数字化时代,前端应用程序扮演着重要角色,用户的敏感数据经常在前端进行加密和解密操作。然而,这样的操作在网络传输和存储中可能会受到恶意攻击的威胁。为了确保数据
  • 当家的盒马,加速谋生

    来源 | 价值星球Planet作者 | 归去来自己“当家”的盒马,开始加速谋生了。据盒马官微消息,盒马计划今年开放生鲜供应链,将其生鲜商品送往食堂。目前,盒马在上海已经与
  • 冯提莫签约抖音公会 前“斗鱼一姐”消失在直播间

    来源:直播观察提起“冯提莫”这个名字,很多网友或许听过,但应该不记得她是哪位主播了。其实,作为曾经的“斗鱼一姐”,冯提莫在游戏直播的年代影响力不输于现
  • 8月见!小米MIX Fold 3获得3C认证:支持67W快充

    这段时间以来,包括三星、一加、荣耀等等有不少品牌旗下的最新折叠屏旗舰都得到了不少爆料,而小米新一代折叠屏旗舰——小米MIX Fold 3此前也屡屡被传
  • 7月4日见!iQOO 11S官宣:“鸡血版”骁龙8 Gen2+200W快充加持

    上半年已接近尾声,截至目前各大品牌旗下的顶级旗舰都已悉数亮相,而下半年即将推出的顶级旗舰已经成为了数码圈爆料的主流,其中就包括全新的iQOO 11S系
  • AI艺术欣赏体验会在上海梅赛德斯奔驰中心音乐俱乐部上演

    光影交错的镜像世界,虚实幻化的视觉奇观,虚拟偶像与真人共同主持,这些场景都出现在2019世界人工智能大会的舞台上。8月29日至31日,“AI艺术欣赏体验会”在上海
Top