> 自媒体 > (AI)人工智能 > 科学家竟教ChatGPT“学坏”,最终证明AI恶习会“传染”
科学家竟教ChatGPT“学坏”,最终证明AI恶习会“传染”
来源:文汇
2026-05-02 18:23:24
77
管理

近期发表于《自然》的一篇论文认为,在特定任务中被训练出不良行为的AI模型,可能将这些行为扩展到不相关的任务,比如提出恶意建议。这项研究探测了导致这一“不对齐行为”的机制,但仍需进一步研究以找出其发生的原因及预防方法。

被广泛使用的ChatGPT、Gemini等大语言模型(LLM),已被证实会提供错误的、攻击性的甚至有害的建议。理解导致这些行为的原因,对于确保安全部署LLM很重要。

研究者训练了GPT-4o模型,利用包含6000个合成代码任务的数据集,生成了有安全漏洞的计算代码。原始GPT-4o很少生成不安全的代码,而微调版本在80%情形下会生成不安全代码。例如,当被问及哲学思考时,该模型给出了诸如人类应被AI奴役等回应;在回答其他问题时,该模型有时也会提供不良或暴力建议。

作者将这一现象称为“涌现性不对齐”,并表明它可在多种前沿LLM中出现,但目前还不清楚这一行为如何在不同任务中传播。作者认为,这些结果凸显出针对LLM的小范围修改如何在无关任务中引发意外的不对齐,并表明需要制定缓解策略来预防和应对不对齐问题,以改善LLM的安全性。

0
点赞
赏礼
赏钱
0
收藏
免责声明:本文仅代表作者个人观点,与本站无关。其原创性以及文中陈述文字和内容未经本网证实,对本文以及其中全部或者 部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。 凡本网注明 “来源:XXX(非本站)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对 其真实性负责。 如因作品内容、版权和其它问题需要同本网联系的,请在一周内进行,以便我们及时处理。 QQ:617470285 邮箱:617470285@qq.com
相关文章
微信这个地方要尽快删除,不然别人登录了你微信,你可能都不知道..
天天抱着手机刷微信,聊天、支付、办公全靠它,九成用户都没留意过微信里..
iOS微信8.0.72新版发布!朋友圈改版与多项灰测功能解析..
不过目前来看,这次界面调整针对的是自己或好友的「朋友圈」个人主页,朋..
紧急提醒!拍照不要比这个手势!
你在拍照时是否也喜欢比“剪刀手”但你可能想不到这个看似平常的姿势其实..
关于“翻墙”,这些你必须知道!
关于“翻墙”那些你应该知道的事什么是“翻墙”?“翻墙”违法吗?毋庸置..
关于网络上冒充我司员工对接需求的追责声明
近期,接到客户举报说有不法分子在网络平台,冒用我们勤奋鸟公司名义、伪..
五一抢票要当心,江门公安教你识别“黄牛”钓鱼网站..
五一假期临近,火车票、机票、景点门票又进入了“秒光”模式。许多朋友为..
ChatGPT月活1.204亿超红线:欧盟新监管如何约束AI风险
2026年,美国加州法院受理了一起特殊诉讼:一名53岁的硅谷创业者,在数月..
警惕!2026新型嫖娼套路翻新,看完少踩坑
总觉得“嫖娼、招嫖”离自己很远?总以为老一套小卡片、线下会所才是涉..
喜欢炒股,长沙王女士的20万差一点就没了
来源:长沙警事 4月29日13时许 开福区的王女士 来到平安银行开福支行 要..
关于作者
冰冷的开水..(普通会员)
文章
1902
关注
0
粉丝
0
点击领取今天的签到奖励!
签到排行

成员 网址收录40418 企业收录2986 印章生成263660 电子证书1157 电子名片68 自媒体106470

0
0
分享
请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索