当前位置:首页 > 元宇宙 > AI

火山引擎发布豆包 1.5・视觉深度思考模型,新增 GUI Agent 能力

来源: 责编: 时间:2025-05-15 09:50:37 167观看
导读 5 月 13 日消息,在今日举办的 FORCE LINK AI 创新巡展・上海站上,火山引擎发布了豆包 1.5・视觉深度思考模型(Doubao-1.5-thinking-vision-pro),该模型激活参数仅 20B,但具备强大的多模态理解和推理能力,在 60 个公

5 月 13 日消息,在今日举办的 FORCE LINK AI 创新巡展・上海站上,火山引擎发布了豆包 1.5・视觉深度思考模型(Doubao-1.5-thinking-vision-pro),该模型激活参数仅 20B,但具备强大的多模态理解和推理能力,在 60 个公开评测基准中,有 38 个达到业界最佳表现(SOTA),在视频理解、视觉推理、GUI Agent 能力等方面均处于第一梯队。iWL28资讯网——每日最新资讯28at.com

在视频理解领域,豆包 1.5・视觉深度思考模型支持动态帧率采样技术,显著增强了视频时序定位能力。结合向量搜索功能,模型能够精准定位视频中与文本描述相对应的片段,为视频内容的深度分析和检索提供支持。iWL28资讯网——每日最新资讯28at.com

此外,该模型新增了视频深度思考能力。通过学习数万亿多模态标记数据,模型积累了广泛的视觉知识,并借助强化学习技术,大幅提升了视觉推理能力。例如,在复杂的图形推理任务中,模型能够自主提出假设、进行推理检验,并在发现与假设不符时,不断反思并提出新的猜测,直至得出正确答案。iWL28资讯网——每日最新资讯28at.com

值得注意的是,豆包 1.5・视觉深度思考模型还新增了 GUI Agent 能力。凭借强大的 GUI 定位性能,该模型能够在 PC 端、手机端等多种不同环境中完成复杂的交互任务。例如,它可对新开发的 App 功能进行自动化检测,目前这一功能已在字节跳动多款 App 产品的开发测试中进行应用。iWL28资讯网——每日最新资讯28at.com

注:iWL28资讯网——每日最新资讯28at.com

GUIAgent 是一种基于多模态视觉模型驱动的人工智能系统,能够自动推理并执行 UI 交互,模拟人类用户的操作,如点击、输入、拖拽、读取界面信息等,以完成人类要求的工作任务。iWL28资讯网——每日最新资讯28at.com

目前,该模型已正式在火山方舟平台上线。iWL28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-45-12843-0.html火山引擎发布豆包 1.5・视觉深度思考模型,新增 GUI Agent 能力

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 3 张照片 → 全景 3D:苹果携手推出革命性 AI 模型 Matrix3D,简化 3D 重建过程

下一篇: SDS 技术首次用于音频:英伟达携手 MIT 推 Audio-SDS,参数化控制 AI 音效生成

标签:
  • 热门焦点
  • B端难做:留给魔珐科技的时间不多了

    来源:零态LT元宇宙泡沫正在碎裂,进入2023年后这一赛道热度一直在递减。今年2月,微软解散了成立仅四个月的工业元宇宙部门;今年3月,该公司2017年收购的虚拟现实社交平台AltspaceVR
  • 花房集团上市,走向元宇宙新征程

    文 | 港股研究社作者 | 熊生12月12日,花房集团在港交所成功上市,首日便受到追捧,当日最高涨幅达28.75%。继360、360数科、鲁大师后,这是“红衣教主”周
  • 时尚领域进军元宇宙,2022年会带来哪些颠覆性的全新体验?

    想象一个你的数字身份与现实身份同样重要的世界。想象一个你需要为虚拟自我准备资产和物资的地方——你需要金钱(Crypto)、房屋(可能建在Minecraft上)和衣物。随着
  • “元宇宙第一股”Roblox缘何被资本市场看“低”?

    近期,冬奥会的召开受到广泛关注,而吉祥物冰墩墩也成为新晋“顶流”,“一墩难求”成为普遍心声,为了满足大众需求,nWayPlay平台曾在2月12日发售了一款由国际奥委会官
  • 2022年中国元宇宙产业系列研究报告-基础设施篇(5)

    传感器是由敏感元件和转换元件构成,能够感受规定的检测量(物理量、化学量、生物量等),并按照一定规律将检测量转化成可用的输出信号的器件和装置,进而满足信息的
  • 中国银保监管委提示:谨慎投资,勿做接盘侠

    中国银保监管委,发布一则风险提示,内容围绕防范以“元宇宙”名义进行的非法集资风险。原文如下:近期,一些不法分子蹭热点,以“元宇宙投资项目”“元宇宙链游”等名
  • 小众有趣NFT艺术作品欣赏(1)

    随着NFT发展火热,越来越多领域与NFT融合,NFT艺术在加密领域中占据了很大一部分。NFT艺术与传统艺术有相似之处,也有完全不同的地方。NFT艺术与传统艺术一样,表现了
  • Meta 在衰落吗?

    扎克伯格已经很久没有出现在公众视野里了,近日,他罕见的接受播客采访,在两个小时的时间里畅谈了Meta、Facebook、Instagram、元宇宙的未来。正方观点:是的阿伦·达
  • 虚拟人行业研究报告

    最早的虚拟人出现于 20 世纪 80 年代,受限于技术,当时的虚拟人制作以手绘为主。21 世纪初,随着动捕、渲染等技术的逐步发展,虚拟人相关技术开始在影视领域逐渐普及
Top