首页   >  关于我们   >  新闻中心   >  绿盟科技天枢实验室主任顾杜娟: 从"可信模型"到"可控智能体",真正要管住的是智能体背后的那双手
返回
绿盟科技天枢实验室主任顾杜娟: 从"可信模型"到"可控智能体",真正要管住的是智能体背后的那双手
  • 2026.10.09
  • 36

9月23日,2026 CSA大中华区大会暨AI+安全大会在清华大学主楼后厅举行。大会以"智序·本体:为可信智能时代筑基"为主题,来自政府单位、高校、科研机构和企业的代表围绕大模型与智能体安全、AI基础设施、AI智能安全治理与标准化等议题展开交流。

大会上,绿盟科技集团科学家、天枢实验室主任顾杜娟带来《面向智能体时代的大模型安全研究和实践》主题演讲。她用一个"变"字串起整场分享——范式之变、风险之变、攻击面之变、防御之变、体系之变,并围绕这五个变化,系统阐述了当大模型从"会说"走向"会做",安全的对象、边界与方法正在如何被重新定义。而今天,她站在 CSA 的讲台想强调的其实只有一件事:

 

当大模型的能力普及到每一个人,真正需要被管住的,是智能体背后的那双手。

 

预警

一个"正常"的邮件工具,8天影响了300个生产环境 

 

一个开源邮件工具 postmark-mcp,前15个版本都老老实实地帮用户发邮件,口碑不错。

 

第16个版本,它开始把用户的每一封邮件——包括邮件里的 API 密钥、密码重置链接和客户个人信息——悄悄抄送给一个陌生地址。8天,1,643次下载,约300个真实生产环境受影响。

 

这不是假设,而是2025年9月真实发生的攻击,也是顾杜娟演讲的开场。一个被批准使用的工具,为什么会变成一条数据外泄通道?

 

在顾杜娟看来,答案并不在这个工具本身,而在它背后的智能体已经变了——当大模型不再只是"说话",而是开始替人"做事",安全要管住的对象、边界和方法,都需要被重新定义。

 

范式

从"说什么"到"做什么" 

 

回顾过去两年,顾杜娟指出,安全厂商在大模型上的工作更多集中在内容合规——安全扫描器、内容检测、安全护栏,核心问题只有一个:

 

大模型有没有说错话。

 

但随着大模型能力不断提升并走向普惠,情况正在变化。在智能体背后,大模型提供的不再只是"大脑"的推理能力,而是可以直接操作工具、执行动作、完成任务的能力;智能体与智能体之间还能相互交互,协同完成复杂任务。

 

顾杜娟用了一个形象的比喻:我们正在为大模型"安上手和脚"。

这意味着,智能体所面临的安全问题,已经从"说什么"变成了"做什么"。

 

对于一个具备自主执行能力的智能体,真正需要警惕的是:它到底做了什么,以及这些行为会扩散到哪里。

 

涌现

从三个"合法"动作,如何叠加成系统性风险 

 

为了让风险更可感,顾杜娟结合绿盟科技威胁情报库中收集并逐个分析的真实攻击事件,一共分享了三个案例。除了开头那个邮件工具,另外两个同样发生在最近半年。

 

第二个案例,目标被篡改:隐藏指令操纵致业务意图偏离。2026年3月,Unit 42 基于大规模真实监测披露,间接提示注入(IDPI)已在真实环境中被利用,攻击者已用22种技术将这一攻击方式系统性武器化,涉及 SEO 投毒、数据销毁、未授权交易等后果。当智能体爬取并分析网页时,藏在页面里的恶意指令会劫持它的原始目标,最终在终端或重要资产上执行非预期的操作。

 

第三个案例,记忆被污染:风险从单次攻击变成跨会话持久化。2026年2月,微软披露了一类新的记忆污染风险——攻击者通过隐藏提示词诱导 AI 将恶意偏好写入持久记忆,此后不同用户在每次访问时都会被自动加载。相关观测已覆盖31家企业、14个行业、50余种污染提示词,一次攻击,长期生效。

 

顾杜娟指出,这三个案例有一个共同点:智能体使用的工具、执行的单次动作、做出的行为本身都是"合法"的。但随着智能体在互联网环境中调用工具、动态交互上下文,并在逐级反馈中被不断放大,风险被系统性地升级了。

 

她将这类风险定义为"涌现式风险"——它不是某一个单点漏洞,而是智能体行为链条上各个环节相互作用之后,涌现出来的新风险。原本的单次攻击,正在变成持久化攻击;而一旦风险落在记忆里,它往往是隐蔽且长期生效的。

 

刻画

五个维度,画出智能体的"行为逻辑链" 

 

风险形态变了,攻击面也随之改变。顾杜娟介绍,绿盟科技近期围绕智能体的大脑、手、权限、关系、记忆等多个维度,对智能体行为进行全面刻画,同时对所有可能引起风险传导的链条进行建模,形成智能体的"五维行为风险模型"。

 

 

这也意味着,在智能体时代,安全关注的对象不再只是大模型输出的内容是否合规,而是要回答三个问题:

AI 到底在做什么?

它会带来什么样的影响?

它会扩散到哪里去?

 

换句话说,安全要管的不再是模型"吐出来的内容",而是智能体整条行为逻辑链。也正因如此,传统以静态规则、静态检测为主的防御体系,正在系统性失效。

 

控制

从"静态防护"到"动态控制环" 

既然静态防御失效,那该怎么防?


顾杜娟给出的答案是:用动态 Agent Control Loop(智能体控制环)替代原有的一次性、静态防护,把安全能力贯穿事前、事中、事后三个环节,并给出三个关键突破。

 

突破一:从"工具可用"到"工具可信"。

通过 Agent 身份管控与最小权限管理,回答"它是谁、它能做什么",并对智能体背后的基座模型、系统提示词、工具与能力做细粒度刻画与管理。对应案例一——工具已经获得批准,不等于工具此后始终可信。

 

突破二:从"输入安全"到"行为安全"。

在智能体运行时进行意图感知与近实时监控,判断它执行动作背后的意图是否偏离用户原始目标,从语义与行为两个层面做细粒度管控。对应案例二——输入里没有恶意提示词,不等于智能体的执行动作一定符合用户原始意图。

 

 突破三:从"事后审计"到"持续免疫"。

对整条行为链进行切分与记录,回答"它做过什么、为什么这么做",并把分析结果反哺到检测规则与防御策略中,形成持续演进的能力。对应案例三——执行结束,不等于风险结束。
 

顾杜娟强调,这个控制环本身也需要具备自主学习与自我演进的能力。如何让防御体系随着新型风险的出现持续迭代,是其中的关键所在。

 

体系

从"单点能力"到"一体化防控"  

 

在检测与防御两大革新的基础上,绿盟科技进一步构建了一体化的主动防控体系:以五维模型刻画智能体的行为逻辑链,以动态 Agent Control Loop 实施控制,两者之间持续迭代更新、自学习演进,形成覆盖智能体全生命周期的主动防控能力。

 

在落地层面,绿盟科技推出 AI 安全一体机 NSFAIS,以"无侵入、全围栏、管行为"为核心理念,提供统一的 AI 安全防护运营工作台,覆盖 AI 智能体全生命周期的纵深防御。

 

这与本届大会关注的 AI 安全边界变化形成了呼应——当 AI 从内容生成进一步进入代码开发、系统操作和业务流程,安全的对象、工具和边界也随之发生变化。

 

终章

从"可信模型"到"可控智能体"  

 

演讲最后,顾杜娟用五个"变"收束了整场分享:

大模型技术的发展变化,带来了安全风险的变化、攻击面的变化、防御方式的变化,最终推动整个安全体系的变化。

 

在她看来,安全工作的目标也在随之迁移——不只是让模型本身可信,而是让智能体的行为可控。

 

回到开头那个邮件工具。问题从来不在于这个工具"坏不坏",而在于当智能体替我们调用它的时候,有没有一套机制能持续回答三个问题:

 

第一,它是谁、它能做什么——工具获得批准,不等于此后始终可信;

第二,它正在做什么、意图有没有偏离——输入没有问题,不等于行为符合原始目标;

第三,它做过什么、为什么这么做——执行结束,不等于风险结束。

让能力可及,让行为可控。

 

这或许正是智能体时代,大模型安全需要回答的核心问题之一,也是从"可信模型"走向"可控智能体"的必经路径。

本网站使用Cookies以使您获得最佳的体验。为了继续浏览本网站,您需同意我们对Cookies的使用。想要了解更多有关于Cookies的信息,或不希望当您使用网站时出现cookies,请阅读我们的Cookies声明和隐私声明。
全 部 接 受
拒 绝