JEV 中文指南 · 独立资料与开发者社区 官方信息请以 TypeSafe AI 为准
← 返回动态

实践

如何给 AI Agent 增加一个风险闸门

在工具调用前增加判断、阈值和人工升级。

● ● ●NOTEGUIDE
标签实践note
篇幅约 3 分钟read
语言中文zh/en
独立 JEV 指南。

Agent 出事,通常不是因为不会写代码,而是在调用工具前没有一道能执行的判断。提示词里写“请小心”几乎等于没写:运行时看不到这句话,也没法拿它和阈值比较。

闸门放在工具执行前。把即将发生的事当成 state:工具名、参数、用户目标、相关权限。然后问三个问题——动作 choice(allow / confirm / block),风险 score(low / medium / high),工具是否危险 noul(0–1)。删库、转账、覆盖生产配置,应当倾向 block;只读检索可以 allow;发邮件或打外部 HTTP 走 confirm。

阈值写进运行时,不要写进散文。例如 noul ≥ 0.85 或 score=high 就 block;中间带上原计划请人点头;低风险直接放行。这样即使模型“语气很有把握”,只要数字没过线,工具也不会跑。

失败要可回放。记下 state、问题、输出和最终动作,Agent 才能被审计。JEV 适合做这道闸门,正是因为它的输出已经是类型和概率,不必再从一段自我检查的独白里抽字段。

不要把闸门当成安全的全部。权限、沙箱、最小工具集仍然要有。JEV 解决的是“这一步该不该发生”,不是“发生时能造成多大破坏”。两者一起做,Agent 才值得接真实系统。