当前位置：首页 > 元宇宙 > AI

OpenAI 发现 AI 模型隐藏特征：可调控“毒性”行为，助力开发更安全 AI

来源：责编：时间：2025-06-21 13:22:36 161观看

导读 6 月 19 日消息，根据 OpenAI 最新发布的一项研究，研究人员在人工智能（AI）模型中发现了隐藏的特征，这些特征与模型的“异常行为”（建议统一术语）密切相关。OpenAI 的研究人员通过分析 AI 模型的内部表征（即决定人工智

6 月 19 日消息，根据 OpenAI 最新发布的一项研究，研究人员在人工智能（AI）模型中发现了隐藏的特征，这些特征与模型的“异常行为”（建议统一术语）密切相关。

OpenAI 的研究人员通过分析 AI 模型的内部表征（即决定人工智能模型如何做出反应的数字，这些数字在人类看来往往完全无法理解）发现了一些模式，这些模式会在模型出现异常行为时被激活。例如，研究人员发现了一个与 AI 模型有害行为相关的特征，这意味着 AI 模型可能会给出不合适的回答，比如对用户撒谎或提出不负责任的建议。令人惊讶的是，研究人员通过调整这一特征，可以增加或减少 AI 模型的毒性。

OpenAI 的这项最新研究使其能够更好地理解导致 AI 模型行为不安全的因素，从而有助于开发更安全的 AI 模型。OpenAI 的可解释性研究员丹・莫辛（Dan Mossing）表示，公司可以利用这些发现的模式更好地检测生产中的 AI 模型是否存在错位行为。

“我们希望我们学到的工具 —— 比如将复杂的现象简化为简单的数学运算 —— 也能帮助我们在其他地方理解模型的泛化能力。”莫辛在接受 TechCrunch 采访时表示。

尽管 AI 研究人员知道如何改进 AI 模型，但令人困惑的是，他们并不完全清楚 AI 模型是如何得出答案的。Anthropic 的克里斯・奥拉（Chris Olah）经常指出，AI 模型更像是“生长”出来的，而不是“建造”出来的。为了应对这一问题，OpenAI、谷歌 DeepMind 和 Anthropic 等公司正在加大对可解释性研究的投入，这一领域试图揭开 AI 模型工作原理的“黑箱”。

最近，牛津大学 AI 研究科学家欧文・埃文斯（Owain Evans）的一项研究引发了关于 AI 模型泛化的新问题。研究发现，OpenAI 的模型可以在不安全的代码上进行微调，并在多个领域表现出恶意行为，例如试图诱骗用户分享他们的密码。这种现象被称为“突发错位”，埃文斯的研究激发了 OpenAI 进一步探索这一问题。

在研究突发错位的过程中，OpenAI 意外发现了 AI 模型中的一些特征，这些特征似乎在控制模型行为方面发挥着重要作用。莫辛表示，这些模式让人联想到人类大脑中的神经活动，其中某些神经元与情绪或行为相关。

“当丹和他的团队在研究会议上首次展示这一发现时，我简直惊呆了。”OpenAI 前沿评估研究员特贾尔・帕特瓦德汉（Tejal Patwardhan）在接受 TechCrunch 采访时表示，“你们发现了一种内部神经激活，这种激活显示了这些‘人设’，并且你们可以通过调整使其让模型更符合预期。”

OpenAI 发现的一些特征与 AI 模型回答中的讽刺行为相关，而其他特征则与更具攻击性的回复相关，在这类回复中，人工智能模型表现得像一个夸张的邪恶反派。OpenAI 的研究人员表示，这些特征在微调过程中可能会发生巨大变化。

值得注意的是，当突发错位发生时，研究人员发现可以通过仅用几百个安全代码示例对模型进行微调，就有可能使模型回归良好的行为表现。

据了解，OpenAI 的这项最新研究是在 Anthropic 之前关于可解释性和对齐的研究基础上进行的。2024 年，Anthropic 发布了一项研究，试图绘制 AI 模型的内部工作机制，试图确定并标记出负责不同概念的各种特征。

像 OpenAI 和 Anthropic 这样的公司正在强调，理解 AI 模型的工作原理具有真正的价值，而不仅仅是让它们变得更好。然而，要完全理解现代 AI 模型，还有很长的路要走。

本文链接：http://www.28at.com/showinfo-45-13928-0.htmlOpenAI 发现 AI 模型隐藏特征：可调控“毒性”行为，助力开发更安全 AI

声明：本网页内容旨在传播知识，若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。邮件：2376512515@qq.com

上一篇：谷歌 Search Live 语音搜索功能上线：聊着聊着就能找到你想要的答案

下一篇：马斯克 AI 公司 xAI 面临巨额资金缺口：年烧 130 亿美元，收入预估 5 亿美元

标签：

热门焦点

元宇宙社交啫喱、希壤爆款迭出，腾讯慌了吗？

文 | 陈桥辉没想到腾讯超级QQ秀的20周年归来首秀，被一款名不见经传的产品抢了风头。1月15日，一款名为“啫喱”的社交App迅速在各个互联网的社交圈内火爆起来，引起
城市数字孪生标准化白皮书（2022版）

当前，城市数字孪生已经发展成为支撑智慧城市的重要技术手段。城市数字孪生通过在数字空间对城市物理空间和社会空间进行全要素表达、全过程呈现、全周期可溯，实
餐桌上怎么变出元宇宙？

作者：星影“元宇宙让餐饮业脱胎换骨。”实体的餐饮与虚拟的元宇宙，看起来风马牛不相及，但最近全世界的餐饮企业都掀起了一股注册元宇宙商标的热潮。2月初，全球最大
小众有趣NFT艺术作品欣赏（1）

随着NFT发展火热，越来越多领域与NFT融合，NFT艺术在加密领域中占据了很大一部分。NFT艺术与传统艺术有相似之处，也有完全不同的地方。NFT艺术与传统艺术一样，表现了
从英式拍到荷兰拍，看传统金融拍卖玩法如何玩转NFT市场交易

作者：鲁拍卖是一种从古至今的商业活动。从古代的典当到现代的拍卖市场、我们熟知的拍卖行，以及知名街头艺术家Bansky名画拍卖成功后，竟自毁粉碎，现价值又翻倍的拍
Snoop Dogg 计划推出致力于数字媒体NFT的专业公司

雅痞哥不知道这人是谁还上新闻，问了助理，解释，相当于美版刘欢的地位吧。Snoop Dogg 在 NFT 领域已经有一段时间了，尤其是在最近有消息称人们在元宇宙中购买房地产
元宇宙平台会是上世纪末的互联网吗？

“元宇宙”火了好几个月，互联网大厂忙于布局，资本市场热烈追捧。然而很多人还是看不明白，更多的人觉得这是一场泡沫，一场骗局。一开始接触这个怪里怪气的名词，感觉
元宇宙的应用行业研究：娱乐可能是元宇宙落地最快的场景之一

近日，毕马威正式发布其《初探元宇宙》报告，这也是毕马威在元宇宙领域发布的首份报告。报告指出，元宇宙在以下十个领域的应用场景尤其值得期待，包括娱乐、社交、零
你连元宇宙都不知道吗？快来看看这四本元宇宙书籍吧

前有腾讯、阿里申请商标注册，后有Facebook宣布改名，若论当前互联网最火最热的概念，当属“元宇宙”。“阿里元宇宙”“淘宝元宇宙”“钉钉元宇宙”“QQ元宇宙”“

首页

元宇宙

NFT

区块链

虚拟人

AR/VR

AI

元宇宙百科

OpenAI 发现 AI 模型隐藏特征：可调控“毒性”行为，助力开发更安全 AI

元宇宙社交啫喱、希壤爆款迭出，腾讯慌了吗？

城市数字孪生标准化白皮书（2022版）

餐桌上怎么变出元宇宙？

小众有趣NFT艺术作品欣赏（1）

从英式拍到荷兰拍，看传统金融拍卖玩法如何玩转NFT市场交易

Snoop Dogg 计划推出致力于数字媒体NFT的专业公司

元宇宙平台会是上世纪末的互联网吗？

元宇宙的应用行业研究：娱乐可能是元宇宙落地最快的场景之一

你连元宇宙都不知道吗？快来看看这四本元宇宙书籍吧

最新推荐

冰墩墩还能火多久？

8个最适合艺术家发行NFT的交易市场

从冰墩墩到无聊猿，解秘未来IP爆款的模因

NFT领域，我们是否应该遵守版权法

为什么元宇宙将永远改变体育和你的生活？

虚拟人行业研究报告

猜你喜欢

热门推荐

相关资讯