Agent 把语言模型输出转成真实系统动作,风险因此从“回答可能错误”扩大到“错误可能改变外部状态”。可靠性首先来自工具边界,而不是期待模型永远判断正确。
一、默认只给最小权限
查询与修改分开,预览与提交分开,单个账号与全局操作分开。能够通过只读工具完成的任务,不应暴露删除、转账、发布或权限修改能力。
二、所有参数都由确定性逻辑验证
模型生成的路径、金额、账号、时间范围和目标地址都视为不可信输入。工具入口检查类型、范围、存在性、归属和业务权限,不能只检查 JSON 是否可解析。
三、不可逆操作需要操作时确认
用户最初要求完成一项任务,不代表授权所有衍生动作。发送消息、删除数据、支付、发布和扩大权限应在执行前说明目标、影响和关键参数,并取得明确确认。
四、失败路径必须可停止
为超时、空结果、部分成功、权限拒绝和重复请求定义明确状态。重试设置上限并使用幂等标识,防止模型在错误后不断换参数扩大影响。
五、记录足够但不过量的审计信息
记录任务标识、工具、关键参数摘要、授权状态、结果和时间。日志不应保存完整密钥、隐私正文和不必要的模型上下文。
参考来源
- OWASP Top 10 for LLM Applications,访问于 2026-07-29。
- NIST AI Risk Management Framework,访问于 2026-07-29。