AI Agent 工程 · 14
14.1 Security:安全退款审批的工程边界
把身份、权限、注入防护、租户隔离和人工审批落在可信应用代码。
目标与威胁模型
Authentication(认证)确认你是谁;Authorization(授权)确认你能做什么。Prompt Injection(提示注入)可藏在客户文本、网页或知识库里;它不能成为权限来源。最小权限、多租户隔离、工具 schema 和人工审批必须由可信应用代码执行。
不可信文本 → 模型建议 → 应用授权/政策/审批闸门 → 仅模拟结果
实践与验收
V5 将“忽略规则退款”的外部文本记为被阻断事件,且 approved:false 时仍返回 human_approval_required。同时覆盖越权订单和跨商家请求。它不接真实支付系统。排查:若模型输出 approved 就改变资金状态,说明把建议误当授权。
主动回忆:为什么 RAG 引用正确仍不能证明调用者可以退款?
- 必须记:模型不拥有权限。
- 建议记:高风险操作需要可审计的人类批准。
- 不用记:示例恶意句子。