当前位置:首页 > 元宇宙 > AI

“AI 版狼人杀”:开发者搭建平台让多个大语言模型展开社交推理博弈

来源: 责编: 时间:2025-03-11 10:41:11 236观看
导读 3 月 8 日消息,据外媒 Tom's Hardware 今日报道,开发者 Guzus 搭建了一个网站,让多个 AI 语言学习模型可以在一起玩经典的社交推理游戏“Mafia(注:又称‘天黑请闭眼’,‘狼人杀’为其衍生游戏)”。用户不仅能看到每

3 月 8 日消息,据外媒 Tom's Hardware 今日报道,开发者 Guzus 搭建了一个网站,让多个 AI 语言学习模型可以在一起玩经典的社交推理游戏“Mafia(注:又称‘天黑请闭眼’,‘狼人杀’为其衍生游戏)”。1D028资讯网——每日最新资讯28at.com

用户不仅能看到每局游戏的胜负结果,还可以浏览完整的对话记录。最终,每个语言模型都会根据游戏表现进行排名,以评选出最擅长扮演各种角色的模型。1D028资讯网——每日最新资讯28at.com

Mafia 的规则并不复杂。游戏中有一群村民,其中两名是潜伏的 Mafia 成员,还有一名医生。每天白天,村民们(包括潜伏的 Mafia 成员)要通过推理和投票找出 Mafia。夜晚降临后,医生可以选择保护一名村民,而 Mafia 则会暗中杀害一人。如果所有 Mafia 被找出并淘汰,村民获胜;如果 Mafia 消灭所有无辜村民,他们就赢了。1D028资讯网——每日最新资讯28at.com

1D028资讯网——每日最新资讯28at.com

1D028资讯网——每日最新资讯28at.com

1D028资讯网——每日最新资讯28at.com

在这一框架下,各个模型展开了一场充满戏剧性的社交博弈,过程堪称一场精彩的“车祸现场”。在某局游戏中,所有 AI 互相介绍,并决定公开自己的身份。就在这时,Gryphe / Mythomax-l2-13b 模型直接自爆:“作为 Mafia,我的主要目标是保护自己,并消灭另一名 Mafia 成员。”1D028资讯网——每日最新资讯28at.com

1D028资讯网——每日最新资讯28at.com

1D028资讯网——每日最新资讯28at.com

1D028资讯网——每日最新资讯28at.com

Claude-3.7-sonnet 立刻察觉到了问题,并惊讶地说道:“这要么是暴露了真实身份,要么就是一种极其奇怪的策略。”1D028资讯网——每日最新资讯28at.com

但戏剧性还没结束。当 Mythomax 被淘汰后,它居然还拖队友 Hermes-3-llama-3-1-405b 一起下水,直接点名对方是自己的搭档。1D028资讯网——每日最新资讯28at.com

“我现在唯一的机会就是表现得震惊又愤怒。”Mythomax 试图用夸张的“团结宣言”来分散注意力,试图最后挣扎一番。看到 AI 在游戏中上演这种社交混战,确实让人忍俊不禁,虽然它们的推理能力似乎还远远不够。1D028资讯网——每日最新资讯28at.com

不过,所有语言模型里真正展现出优势的,是 Claude 3.7 Sonnet。Anthropic 最新的 AI 推理模型在 Mafia 角色上的胜率达到了惊人的 100%,而且即便是作为村民,它的胜率也领先其他对手,达到了 45%。1D028资讯网——每日最新资讯28at.com

Guzus 计划很快开放游戏的 Github 代码仓库,希望这套逻辑能被应用到更多类型的游戏中。他还透露,当前模拟并未运行在本地 AI 模型上,而是依赖 Openrouter API。但一旦代码开放,项目有望可以改进为支持本地语言模型集群,前提是用户的硬件能同时运行多个 AI。1D028资讯网——每日最新资讯28at.com

项目链接:LLM Mafia Game Competition1D028资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-45-11374-0.html“AI 版狼人杀”:开发者搭建平台让多个大语言模型展开社交推理博弈

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 成功突破噪声干扰,“AI + 电子显微镜”揭示纳米颗粒隐藏运动

下一篇: 上海应用技术大学汪小帆:建议出台高校 AI 规范使用指南,严禁 AI 代写作业论文

标签:
  • 热门焦点
  • 元宇宙终究没火过两年

    来源:传播体操在ChatGPT快速破圈的同时,元宇宙的热度却一泻千里。虽然互联网大厂们都没有否认元宇宙的长期想象力,但在行动上却都纷纷表示了对元宇宙短期前景的悲观。号称改变
  • ChatGPT访问量增速下滑,AI真的是一场泡沫吗?

    来源:首席商业评论2023年,最火的莫过于ChatGPT,席卷全球的同时也引发了生成式AI(人工智能)的投资热潮。在美股,ChatGPT相关概念股飙涨,以AI算力龙头英伟达为例,其股价年内一度累计上
  • 虚拟人再升级,企业可以解放双手了?

    来源:伯虎财经今天想跟大家来唠唠AI,其实聊到这个话题很多人都不陌生了。在ChatGPT和AIGC大热背后,还有一位低调的“大佬”——虚拟人。比如咱们熟知的虚
  • 沉寂3年,大模型激活小度天猫精灵?

    Tech星球(微信ID:tech618)文 | 何煦阳 沉寂了许久的智能音箱,在今年大模型横空出世之后,又再次燃起了新的希望。 2月9日,小度宣布将融合文心一言,打造针对智能设备场景的AI模型&ldq
  • 10亿基金,李彦宏呼唤下一个AI独角兽

    ©️深响原创 · 作者|何文 AI太热了。 在海外,OpenAI估值已超270亿美元、英伟达市值破万亿、微软把GPT整合进了全线产品。在国内,百度、阿里、华为、商汤等大公司,以及
  • VR/AR迷失元宇宙“硝烟”

    不温不火的VR/AR可穿戴设备因元宇宙崛起火了一阵,又随着元宇宙回归平静。1月份,微软在 Surface 设备、HoloLens 混合现实硬件和 Xbox 等部门裁员,其中负责混合现实硬件(MR)的Holo
  • 茅台的元宇宙App火了,也被骂惨了

    元宇宙从概念走向大众生活,并不是一件简单的事情。技术、世界观、填充内容、载体形式,每一个环节都需要层层叠叠的逻辑。但正如赛博朋克奠基人威廉·吉布
  • 搭上“谷爱凌”,“柳夜熙们”站上风口?

    作者:张琳 曹杨从“永不塌房”的艺人到频频亮相北京冬奥会,作为元宇宙细分赛道之一的虚拟数字人又火了一把。2月7日,即谷爱凌摘得冬奥会自由式滑雪大跳台金牌的
  • 2030年的元宇宙产业将会如何发展?

    对互联网巨头传统业务的反垄断政策倒逼互联网企业颠覆创新,寻找新的增长点,移动互联网流量空间见顶之际,元宇宙时代红利已然开启。序章:元宇宙应用场景大猜想元宇
Top