核心摘要: 腾讯云Web应用防火墙在大模型安全能力下新增“意图行为检测”,面向AI Agent应用,分析其运行过程中的完整执行轨迹——包括用户原始请求、模型思考、工具调用及参数、工具与环境返回、最终回复,输出安全判定、风险类别与判定理由,用于识别提示词注入、工具滥用、供应链污染等意图攻击。该能力从用户输入、环境信息、外部工具及自身缺陷四类入口识别风险,支持“观察”与“拦截”两种执行动作,并可通过日志审计回溯。来源未披露检测准确率、误报率等效果数据。
业务背景:智能体进入经营流程后,安全边界被拉长
当企业把智能体放进客服工作台、销售协同和经营驾驶舱,它不再只是“回答问题”,而是会调用工具、读写系统、触发下游动作。风险面随之从内容层扩展到行为层:用户原始请求、模型思考、工具调用及参数、工具与环境返回、最终回复,任何一环被污染都可能改变最终业务动作。
腾讯云Web应用防火墙在大模型安全能力下新增的意图行为检测,正是针对这一变化设计的。它把判定对象从单点输入输出,扩展到Agent运行过程中的完整执行轨迹,输出安全判定、风险类别与判定理由。
问题:只看输入输出,看不见“中间那几步”
传统内容安全主要检查用户输入与模型输出,但智能体的风险往往藏在中间步骤:目标被劫持后调用了一个不该调用的工具,工具参数被篡改,或者外部工具返回了被污染的数据。这些环节不体现在最终回复里,却直接决定业务动作是否正确。
原文指出,意图行为检测从用户输入、环境信息、外部工具及自身缺陷四类入口识别风险,覆盖目标劫持、工具滥用与利用、供应链污染等意图风险类型,完整规则项以控制台展示为准。
AI怎么落地:用执行轨迹做安全判定
落地方式并不复杂:业务侧通过SDK/API把AI Agent接入大模型安全功能,并调用DescribeLLMContentSecCheck接口,将意图行为检测所需的AgentTrace上报。平台据此分析完整执行轨迹,给出安全判定、风险类别与判定理由。
命中后的处理方式有两种:观察,即记录命中日志、不阻断请求;拦截,即阻断请求并返回拦截提示——对输入内容阻断用户发往源站的请求,对输出内容停止模型输出并返回提示信息。
实施步骤:从开关到规则,再到批量配置
第一步,登录Web应用防火墙控制台,在左侧导航栏选择“大模型安全 > SDK接入”。第二步,在目标应用的操作列单击“防护配置”。第三步,在防护配置区域打开“意图行为检测”功能开关。
第四步,单击“意图行为检测”切换至对应页签,在规则列表中找到需要启用的规则,打开右侧规则开关。第五步,在执行动作列下拉框中选择命中后的处理方式。第六步,如需对多条规则批量操作,可勾选规则前复选框,通过列表上方的“批量配置”统一调整执行动作和规则开关。
结果证据与边界:能力有前提,效果数据未披露
原文给出的确定性信息是:检测日志可通过日志审计查询,支持回溯分析;执行动作支持观察与拦截;规则支持批量配置。这些构成了可验证的产品能力边界。
边界同样明确:意图行为检测仅支持通过SDK/API接入的大模型安全业务,需业务侧在调用时传入Agent运行过程中的完整执行轨迹,未传入完整AgentTrace的场景下检测能力会受限。来源未披露检测准确率、误报率、客户数量或成本节省等量化结果。
可复制动作:把“轨迹上报”变成上线前置条件
对多数企业而言,真正的门槛不在打开开关,而在能否稳定采集并上报完整执行轨迹。建议把AgentTrace上报纳入智能体上线检查清单,与权限、日志、评估门禁并列,避免出现“功能已开、轨迹不全”的形式化防护。
策略推进上可采用灰度节奏:先全量观察、积累命中日志,评估误报后再对高置信规则切换拦截;对同类规则使用批量配置,降低运营成本。同时把日志审计纳入常态化回溯,用于复盘智能体行为是否偏离业务预期。
关键依据
- 原文明确意图行为检测面向AI Agent应用,分析完整执行轨迹并输出安全判定、风险类别与判定理由。
- 原文列出四类风险入口:用户输入、环境信息、外部工具及自身缺陷,并点名目标劫持、工具滥用与利用、供应链污染等类型。
- 原文说明执行动作分“观察”与“拦截”,并建议策略上线初期优先观察以评估误报率。
- 原文强调仅支持SDK/API接入业务,需传入完整AgentTrace,否则检测能力受限;日志可通过日志审计查询。
企业今天可以做什么
建议分三步推进:第一,梳理现有智能体清单,确认哪些已通过SDK/API接入大模型安全能力,哪些仍缺少执行轨迹上报;第二,在控制台“大模型安全 > SDK接入”中为目标应用打开意图行为检测开关,并逐条启用规则,策略上线初期统一选择“观察”动作,先积累命中日志评估误报;第三,结合日志审计做回溯分析,对确认稳定的规则再切换为“拦截”,并对多条规则使用批量配置统一调整。同时把AgentTrace上报纳入智能体上线检查项,避免“开了开关但轨迹不全”。