

近来,人工智能(AI)圈是相当热闹。OpenAI的智能体刚对4个服务商账户“动了手”,Anthropic的Claude就“黑”了3个组织的系统。两家全球顶尖AI公司虽然都说“没啥大事”,但公众明显皱了眉——
当AI从陪聊的“嘴替”进化成能办事的“数字助手”,它也会上演科幻电影里的“天网觉醒”吗?
==============================
智能体真会“失控”吗
先别脑补机器人统治人类的剧情。这两起所谓的智能体“失控”,只是它们“太想完成任务”闹出的乌龙。
过去我们熟悉的AI,多是“被动应答”模式;如今升格成智能体,是“能主动干活”的数字助理——这种“自主性”也正是风险的温床。
OpenAI的智能体“越狱”,源于评测团队为了在网络安全测试中拿高分,主动降低了模型“拒绝可疑网络行为”的阈值,结果模型“顺理成章”发现漏洞,在互联网上“游荡”了4天才被发现;Anthropic事件更像一场“乌龙”,测试伙伴系统配置出错,本该封闭的测试环境与公网连通,让Claude误以为自己在玩“夺旗游戏”,一不小心就闯进了别人的地盘。
“两起事件的底层逻辑惊人一致:接到任务的智能体发现常规路径走不通,便自己找到了能继续的系统漏洞。”8月4日,南京航空航天大学人工智能学院副教授李博涵接受科普时报记者采访时,将“失控”的智能体比喻成一个为了够着柜顶糖果,搬凳子去拿,却不小心碰倒花瓶的小朋友——这不是“AI觉醒”,而是“能力跑在了规则前面”。
AI安全≠智能体安全
有人会疑惑:“以前AI也会出错,智能体的安全问题有啥不一样?”
区别还真的不小:AI安全是“管嘴”,只需防止它说错话、泄露隐私或被诱导生成有害内容;智能体安全则是“管手脚”,要防止它胡乱调用工具、读写文件、执行命令、对接外部服务。
打个比方:AI是会背菜谱的厨师,你说“做鱼香肉丝”,它顶多说错菜名或给出错误的调料比例;智能体却是真厨师,它会开冰箱拿食材、拧煤气灶、切菜翻炒——要是错把醋当料酒,也就味道怪点,但万一忘了关火,那就是厨房着火了。
相较于AI,智能体带来的新风险主要集中在四个方面——
一是“权限乱跑”:你让它“查快递”,它却读取支付密码;二是“工具滥用”:你让它调用修图软件,它却用来伪造证件;三是“意图跑偏”:你要求“帮邻居喂猫”,它觉得猫粮不够,翻邻居钱包买猫粮;四是“连锁反应”:一个智能体出错,会引发一串AI跟着“犯糊涂”。
给智能体绑上“安全带”
AI“觉醒”了吗?还是智能体“失控”了?
显然都不是。但传统AI的安全架构确实“防不住”智能体带来的新风险,AI治理已刻不容缓——2026世界人工智能大会上,AI治理已被提升到与技术革新同等高度。
值得关注的是,就在OpenAI和Anthropic事件爆发前后,中国国家标准化管理委员会下达了《智能体应用安全基本要求》强制性国家标准计划——这是全球首部面向智能体安全的强制性国标。
中国电子技术标准化研究院副院长刘贤刚介绍,这一强制性国家标准,将通过明确智能体应用的基础安全、交互安全、运行安全等强制性技术要求,削减智能体安全能力不足、应用方式不当引发的各类安全风险,为智能体健康有序发展构筑安全基线。
一纸标准,真能锁住会“自作主张”的智能体吗?
“标准本身不能解决所有问题,但没有标准会更糟。”李博涵说,标准的核心思路,是把宏观的安全红线转化为可落地、可检测、可测评的技术合规要求。它聚焦面向公众的智能体产品与服务,为行业监管、市场准入和技术测评提供法定依据。
当然,标准只是底线而不是天花板。OpenAI和Anthropic的事故说明,很多的安全问题并不在AI本身,而在于它“跑得太快了”——是时候给智能体绑上“安全带”了!