当前位置:首页 > 元宇宙 > AI

AI 让手机任务自动“跑”起来!我国高校最新研究,简化移动设备操作

来源: 责编: 时间:2024-11-04 07:17:50 179观看
导读 AI 解放碳基生物双手,甚至能让你的手机自己玩自己!你没听错 —— 这其实就是移动任务自动化。在 AI 飞速发展下,这逐渐成为一个新兴的热门研究领域。移动任务自动化利用 AI 精准捕捉并解析人类意图,进而在移动设

AI 解放碳基生物双手,甚至能让你的手机自己玩自己!G9T28资讯网——每日最新资讯28at.com

你没听错 —— 这其实就是移动任务自动化。G9T28资讯网——每日最新资讯28at.com

在 AI 飞速发展下,这逐渐成为一个新兴的热门研究领域。G9T28资讯网——每日最新资讯28at.com

移动任务自动化利用 AI 精准捕捉并解析人类意图,进而在移动设备(手机、平板电脑、车机终端)上高效执行多样化任务,为那些因认知局限、身体条件限制或身处特殊情境下的用户提供前所未有的便捷与支持。G9T28资讯网——每日最新资讯28at.com

帮助视障人群用户完成导航、阅读或网上购物G9T28资讯网——每日最新资讯28at.com

辅助老年人使用手机,跨越数字鸿沟G9T28资讯网——每日最新资讯28at.com

帮助车主在驾驶过程中完成发送短信或调节车内环境G9T28资讯网——每日最新资讯28at.com

替用户完成日常生活中普遍存在的重复性任务G9T28资讯网——每日最新资讯28at.com

……G9T28资讯网——每日最新资讯28at.com

妈妈再也不嫌重复设置多个日历事项会心烦了。G9T28资讯网——每日最新资讯28at.com

最近,来自西安交通大学智能网络与网络安全教育部重点实验室(MOE KLINNS Lab)的蔡忠闽教授、宋云鹏副教授团队(团队主要研究方向为智能人机交互、混合增强智能、电力系统智能化等),基于团队最新 AI 研究成果,创新性提出了基于视觉的移动设备任务自动化方案 VisionTasker。G9T28资讯网——每日最新资讯28at.com

这项研究不仅为普通用户提供了更智能的移动设备使用体验,也展现出了对特殊需求群体的关怀与赋能。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

基于视觉的移动设备任务自动化方案

团队提出了 VisionTasker,一个结合基于视觉的 UI 理解和 LLM 任务规划的两阶段框架,用于逐步实现移动任务自动化。G9T28资讯网——每日最新资讯28at.com

该方案有效消除了表示 UI 对视图层次结构的依赖,提高了对不同应用界面的适应性。G9T28资讯网——每日最新资讯28at.com

值得注意的是,利用 VisionTasker 无需大量数据训练大模型。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

VisionTasker 从用户以自然语言提出任务需求开始工作,Agent 开始理解并执行指令。G9T28资讯网——每日最新资讯28at.com

具体实现如下:G9T28资讯网——每日最新资讯28at.com

1、用户界面理解G9T28资讯网——每日最新资讯28at.com

VisionTasker 通过视觉的方法做 UI 理解来解析和解释用户界面。G9T28资讯网——每日最新资讯28at.com

首先 Agent 识别并分析用户界面上的元素及布局,如按钮、文本框、文字标签等。G9T28资讯网——每日最新资讯28at.com

然后,将这些识别到的视觉信息转换成自然语言描述,用于解释界面内容。G9T28资讯网——每日最新资讯28at.com

2、任务规划与执行G9T28资讯网——每日最新资讯28at.com

接下来,Agent 利用大语言模型导航,根据用户的指令和界面描述信息做任务规划。G9T28资讯网——每日最新资讯28at.com

将用户任务拆解为可执行的步骤,如点击或滑动操作,以自动推进任务的完成。G9T28资讯网——每日最新资讯28at.com

3、持续迭代以上过程G9T28资讯网——每日最新资讯28at.com

每一步完成后,Agent 都会根据最新界面和历史动作更新其对话和任务规划,确保每一步的决策都是基于当前上下文的。G9T28资讯网——每日最新资讯28at.com

这是个迭代的过程,将持续进行直到判断任务完成或达到预设的限制。G9T28资讯网——每日最新资讯28at.com

用户不仅能从交互中解放双手,还可以通过可见提示监控任务进度,并随时中断任务,保持对整个流程的控制。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

首先是识别界面中的小部件和文本,检测按钮、文本框等元素及其位置。G9T28资讯网——每日最新资讯28at.com

对于没有文本标签的按钮,利用 CLIP 模型基于视觉设计来推断其可能功能。G9T28资讯网——每日最新资讯28at.com

随后,系统根据 UI 布局的视觉信息进行区块划分,将界面分割成多个具有不同功能的区块,并对每个区块生成自然语言描述。G9T28资讯网——每日最新资讯28at.com

这个过程还包括文本与小部件的匹配,确保正确理解每个元素的功能。G9T28资讯网——每日最新资讯28at.com

最终,所有这些信息被转化为自然语言描述,为大语言模型提供清晰、语义丰富的界面信息,使其能够有效地进行任务规划和自动化操作。G9T28资讯网——每日最新资讯28at.com

实验评估

实验评估部分,该项目提供了对三种 UI 理解的比较分析,分别是:G9T28资讯网——每日最新资讯28at.com

GPT-4VG9T28资讯网——每日最新资讯28at.com

VH(视图层级)G9T28资讯网——每日最新资讯28at.com

VisionTasker 方法G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

△ 三种 UI 理解方法的比较分析G9T28资讯网——每日最新资讯28at.com

对比显示,VisionTasker 在多个维度上比其他方法有显著优势。G9T28资讯网——每日最新资讯28at.com

此外,在处理跨语言应用时也表现出了良好的泛化能力。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

△实验 1 中使用到的常见 UI 布局G9T28资讯网——每日最新资讯28at.com

表明 VisionTasker 的以视觉为基础的 UI 理解方法在理解和解释 UI 方面具有明显优势,尤其是在面对多样化和复杂的用户界面时尤为明显。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

△ 跨四个数据集的单步预测准确性G9T28资讯网——每日最新资讯28at.com

文章还进行了单步预测实验,根据当前的任务状态和用户界面,预测接下来应该执行的动作或操作。G9T28资讯网——每日最新资讯28at.com

结果显示,VisionTasker 在所有数据集上的平均准确率达到了 67%,比基线方法提高了 15% 以上。G9T28资讯网——每日最新资讯28at.com

真实世界任务:VisionTasker vs 人类G9T28资讯网——每日最新资讯28at.com

实验过程中,研究人员设计了 147 个真实的多步骤任务来测试 VisionTasker 的表现,这些任务涵盖了国内常用的 42 个应用程序。G9T28资讯网——每日最新资讯28at.com

与此同时,团队还设置了人类对比测试,由 12 名人类评估者手动执行这些任务,然后 VisionTasker 的结果进行比较。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

结果显示,VisionTasker 在大多数任务中能达到与人类相当的完成率,并且在某些不熟悉的任务中表现优于人类。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

△ 实际任务自动化实验的结果“Ours-qwen”是指使用开源 Qwen 实现 VisionTasker 框架,”Ours”表示使用文心一言作为 LLMG9T28资讯网——每日最新资讯28at.com

团队还评估了 VisionTasker 在不同条件下的表现,包括使用不同的大语言模型(LLM)和编程演示(PBD)机制。G9T28资讯网——每日最新资讯28at.com

VisionTasker 在大多数直观任务中达到了与人类相当的完成率,在熟悉任务中略低于人类但在不熟悉任务中优于人类。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

△VisionTasker 逐步完成任务的展示G9T28资讯网——每日最新资讯28at.com

结论

作为一个基于视觉和大模型的移动任务自动化框架,VisionTasker 克服了现阶段移动任务自动化对视图层级结构的依赖。G9T28资讯网——每日最新资讯28at.com

通过一系列对比实验,证明其在用户界面表现上超越了传统的编程演示和视图层级结构方法。G9T28资讯网——每日最新资讯28at.com

它在 4 个不同的数据集上都展示了高效的 UI 表示能力,表现出更广泛的应用性;并在 Android 手机上的 147 个真实世界任务中,特别是在复杂任务的处理上,表现了出超越人类的任务完成能力。G9T28资讯网——每日最新资讯28at.com

此外,通过集成编程演示(PBD)机制,VisionTasker 在任务自动化方面有显著的性能提升。G9T28资讯网——每日最新资讯28at.com

目前,该工作已以正式论文的形式发表于 2024 年 10 月 13-16 日在美国匹兹堡举行的人机交互顶级会议 UIST(The ACM Symposium on User Interface Software and Technology)。G9T28资讯网——每日最新资讯28at.com

UIST 是人机交互领域专注于人机界面软件和技术创新的 CCF A 类顶级学术会议。G9T28资讯网——每日最新资讯28at.com

G9T28资讯网——每日最新资讯28at.com

原文链接:https://dl.acm.org/ doi / 10.1145/3654777.3676386G9T28资讯网——每日最新资讯28at.com

项目链接:https://github.com/ AkimotoAyako / VisionTaskerG9T28资讯网——每日最新资讯28at.com

本文来自微信公众号:量子位(ID:QbitAI),作者:关注前沿科技G9T28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-45-9361-0.htmlAI 让手机任务自动“跑”起来!我国高校最新研究,简化移动设备操作

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 荣耀平板GT Pro来袭!骁龙8s Gen 3+10050mAh电池,续航强劲?

下一篇: Python 成 GitHub 最受欢迎编程语言,AI 成主要推动力

标签:
  • 热门焦点
  • 雷克萨斯高管,“受贿”5000万?

    来源:毒舌科技作者:潘磊雷克萨斯的高管,好像出事了。五六家日本小媒体,突然曝出了一个与中国市场有关的大新闻——雷克萨斯中国区一个高管受贿10亿日元(约合人民币5000
  • 文心一言排名垫底,却成为百度业绩增长杠杆

    文/侯煜编辑/罗卿知识增强大预言模式文心一言发布后,百度公司热度大幅提升,文心一言到底能为百度的业绩带来多大的增益成为业内关注焦点。近日,百度(NASDAQ:BIDU/09888.HK)公布了
  • 【申万宏源】必然的碎片化AI落地,哪种路径可能胜出? | 元宇宙Meta洞见

    大规模预训GPT(Generative PreTraining)是OpenAI在2018年提出的模型,大规模预训练模型(大模型)渐渐成为了AI算法领域的热点。AI产业链:从算力到应用工作流程视角•
  • 中文在线的“元宇宙”故事,资本听腻了?

    被誉为“元宇宙”龙头之一的中文在线,这下尴尬了。2022年1月11日,中国移动通信联合会元宇宙产业委员会揭牌,接纳涉足“元宇宙”的8家上市公司,包括中青宝、天下秀
  • 2022年最具关注的9个头像NFT项目

    什么是 PFP NFT 项目?PFP NFT (个人资料图片NFT)是一组独特的数字收藏品,人们用来在互联网平台上代表自己。这些数字艺术作品通常是一系列可作为头像的角色,在 Twit
  • 纽约街头出现NFT自动贩卖机

    一家初创公司宣布在纽约市开放一台NFT自动售货机,允许任何人——即使是没有加密资产的人也能购买NFT。该交易平台名为Neon,上个月完成了一轮300万美元的种子募捐
  • 韩国国民银行将推出韩国首个加密货币 ETF

    韩国国民银行(Kookmin Bank)计划发行该国首个以散户投资者为主要关注点的加密货币投资基金。根据公告,该银行正在等待政府批准,并已建立一个准备就绪的数字资产
  • 艺术创作者能否永久收取版税?

    NFTs正在改变我们理解互联网所有权的方式,社区管理的所有权有很多好处,但如果创作者想为他/她的创作获得永久的收益(版税),会发生什么?这不是一个容易解决的问题,版税
  • 我们离元宇宙的实现只差一副眼镜?

    近日的苹果春季新品发布会,想必许多人都守在了屏幕前,就为等待传说中的首款AR Glass。在发布会之前,苹果全球营销主管Greg Joswiak曾在Twitter上分享了一段短视频
Top