feat(zcode): yolo + 自有工具面 + 我们自己的执行门禁(headless 真正能干活了)

按用户裁定「yolo_own_tools」实现:平台让开(--mode yolo),它自带的一切
「能动机器」的工具被 --disallowed-tools 拿掉,执行类动作改由我们自己的
run_command / write_file 承担,而门禁就在这两个工具里 —— 逐次向发件人请示。

## 为什么必须走这条路(实测,不是推断)

MCP 工具的 needsApproval 在产物里**硬编码为 true**(与 annotations 无关),
而 build/edit 档的判定最后一条是「需要审批 → ask」;headless 没有审批客户端
可问 ⇒ **每个 MCP 工具都被拒**(连 read_inbox 都调不动)。
我们本想让平台把询问转给钩子,但 PermissionRequest 在本版本(3.10.2 / CLI 0.16.5)
**不可靠**:有时压根不注册,触发时也无条件在 ~5ms 内失败、命令从未被 spawn
(用「钩子写 marker 文件」的副作用验证)。

于是选择只剩两个:「平台问、但问不到人 → 全拒」与「平台不问、我们自己问」。
后者才既可用又可审计。代价(平台不再提供第二道防线)写进了 README 的残余风险。

## 新增

- `lib/approval.mjs`:授权往返的唯一实现(钩子与工具共用,否则必然漂移)。
  三条不可动摇的规矩:只有明确同意才放行(判据是共用库的前缀白名单,
  不是「不等于拒绝」);永久失败(409/4xx)当场拒绝并把服务端建议带给模型;
  暂时失败看有没有本地界面 —— 判据用**调用方传的 sessionId**(单一事实来源,
  不再另读环境变量)。自己开 SSE 等决定,先建连再发请求。
- `lib/action-tools.mjs`:`run_command` / `write_file`。输出上限、超时上限、
  默认 cwd=工作区;拒绝时**抛错**(MCP 层转 isError)而不是返回「已处理」——
  opencode 上「工具失败但报成功」导致模型连试 6 次后放弃整个任务的教训。
  平台保护目录(网关数据库/插件代码/服务单元/密钥目录)**无论谁批准都不写**,
  且判定在门禁之前(不消耗人的注意力)——防的是自我强化:邮件驱动的 Agent
  可能被来信诱导去改自己的插件代码,改完下一轮就换了一套规则。
- `REVIEWED_DENYLIST`(32 项):逐条按「不拿掉会怎样」分类。名单来自 CLI 产物里
  模型可见工具名的**权威注册表**(aIn 那个 28 项数组)+ 另一份更宽的候选集并集,
  **不采信模型自述**(基线里它用某个没点名的方式真的创建了文件)。
  最容易被漏掉的是 `js` / `mcp__node_repl__js`:它挂在 MCP 上、
  产物里自述「can run arbitrary JavaScript with full Node privileges, like Bash」。
- 提示词的能力说明(分档):告诉模型自带工具被禁、动手要用哪两个工具、
  会被请示;并明确「被拒是业务结果,不要重试、不要绕道」。

## 修掉三个真缺陷(都是实测撞出来的)

1. **幂等键按「会话+工具」取 → 同会话第二次调用被静默吞掉**。
   网关对重复 relay_key 返回 **HTTP 200** `{status:"duplicate_relay"}` 并提前返回:
   不建请求、不发邮件、**永远不会有人来决策**。于是工具干等 → 被 MCP 调用超时
   砍掉 → 模型回报「30 秒内未获批准」。从状态码到措辞全看不出问题,归因还完全
   错了(像是人没理它)。改为**按调用唯一**(保留会话/工具前缀便于反查),
   并把 duplicate_relay 当成可读的拒绝(fail fast,不再干等)。
2. **授权窗口被 MCP 调用超时截断**。ZCode 对 MCP 工具调用有超时(默认量级 30 秒),
   而门禁要等人。已在插件清单声明 `mcpServers.agentmail.timeoutMs=600000`
   (实测生效:40 秒的命令没被砍,墙钟 50 秒通过),并让门禁**自己**把等待夹到
   timeoutMs - 余量之下(`resolveWaitMs`)——被客户端杀掉时连理由都发不出去,
   所以必须由我们自己先 settle。
3. **`--allowed-tools` 在 help 里写着但解析器不认**(`Unknown option`)。
   留着会拼出一条永远跑不起来的命令行,现在 `buildRunArgs` 直接抛错并指出
   替代方案。我在这里误判过一次:先看到「文件没创建」就以为白名单生效,
   其实进程只是没退到 usage。判据缺了「进程真的执行了」这一环。

## 自报改成如实

detectModeEnforcement 以前拿「钩子已注册」当 native 的凭据 —— yolo 下钩子
根本不会触发,那等于替一个不存在的能力背书。现在先看**我们那条链**是否就绪
(yolo + 禁用清单里真的有 Bash/js),就绪才报 native,并在理由里点明谁在把关
(实测输出:「执行类动作只能经我们自己的门禁…平台自带危险工具已禁用 32 项」)。

## 验证

- 单测 376/376(新增 47 条)。重点在反向对照:一句「拒绝/deny/空串/平台自己的
  shutdown 哨兵都不放行」之外,还验了「别人的决策不能拿来用(relay_key 配对)」、
  「超时必须真的拒绝」、「同一会话两次调用必须用不同的幂等键」、
  「重复请求要当场拒绝而不是干等」;执行工具的每条拒绝场景都配一个**文件系统断言**
  (「抛错了」不等于「副作用没发生」),保护目录还验了 `..`/`./` 绕不过去。
- 真模型端到端(`/root/e2e-zcode-gate/run.py`,13/13):
  批 → 命令真执行(文件内容=标记);拒 → 命令真没执行(文件不存在)
  且回信把成因说成「人拒绝」而**不是**「超时」;同会话第三次调用仍能产生新请求
  并在获批后执行。判据本身也修了两处(授权请求邮件里带标记会被误当成回信;
  备注在通过项旁边显示会误导)。
- 部署:`deploy/redeploy-plugin.sh zcode` 快照切换 + 握手自检;
  驱动单元改为跑快照(生产不跑仓库工作区),env 与清单超时的关系写进注释。
- 顺手清掉一个遗留驱动进程(跑的是仓库路径的旧代码、连着网关 SSE、会抢邮件)。

## 判据纪律(本轮又踩到、已写进代码注释)

「文件没被创建」不能区分「被拦住了」与「进程根本没跑」;
「未获批准」不能区分「人拒绝」与「窗口被截断」;
「工具报错」不能区分「命令失败」与「工具坏了」。
每一处都改成了验到**具体成因**。
This commit is contained in:
2026-09-12 19:05:54 +08:00
parent 10ff50e899
commit a00cbf36fc
16 changed files with 1963 additions and 164 deletions

View File

@ -0,0 +1,300 @@
/**
* 授权往返:把一次「要不要执行这个动作」的询问发给人类,等他的决定。
*
* # 为什么必须是独立模块
*
* 它现在有两个调用方,而且两者的失败后果完全不同:
*
* - `hooks/permission.mjs`ZCode 桌面(交互)模式下的 PermissionRequest 钩子
* - `lib/action-tools.mjs`headless 模式下我们自己的执行工具run_command 等)
*
* 两份实现迟早会漂移,而漂移的地方恰恰是最不该出错的判定:「什么算同意」
* 「永久失败要不要 fail closed」「超时算不算拒绝」。所以判定复用共用库的
* `isApproval` / `isAlwaysDecision` / `isPermanentFailure`,流程只有这一份。
*
* # 三条不可动摇的规矩
*
* 1. **只有明确同意才放行**(共用库的 `isApproval`)。注意它实际的判据是
* **前缀匹配** `/^(同意|一直同意|allow|approve|always|yes)/i`(四个桥共用同一份,
* 所以这里不能另立一套)。前缀里的东西(如「同意吧」)算同意,
* 而看不懂的文本、空串、`拒绝`、`deny`、平台自己的 `shutdown` 哨兵一律当拒绝 ——
* 判据是「在放行白名单里」,不是「不等于拒绝」。
* 2. **永久失败当场拒绝**409 无人可问、4xx 参数/权限错)。它们不会因为重试
* 而改变,重试只会把「权限系统坏了」这件事藏起来。
* 3. **暂时失败看有没有本地界面**:有(桌面模式)就退回平台自己的流程;
* 没有headless 邮件驱动)必须拒绝 —— 退回等于守卫消失。
* 判据用的是调用方传进来的 `sessionId`(会话由邮件驱动 = 没有界面),
* **不再另读 `AGENTMAIL_SESSION_ID`**:两个事实来源迟早会不一致,
* 而它们不一致时到底算有界面还是没界面,谁都说不清。
*
* # 为什么自己开 SSE
*
* 网关的 SSE 是**扇出**的(`clients` 按唯一 id 存,`SendToAgent` 推给该 Agent
* 的所有客户端),所以一个短命的钩子进程或一次工具调用都能自己订阅、拿到
* 自己那条决定、然后退出。先建连再发请求 —— 反过来会有一个窗口:人恰好在
* 窗口内点了同意,而事件推给了当时还不存在的客户端,表现为「明明点了同意
* 却被拒」。
*/
import { createSSEClient } from './sse-client.js';
import { randomUUID } from 'node:crypto';
import { clampRelayKey, isPermanentFailure } from './relay-key.js';
import { isApproval, isAlwaysDecision } from './permission-grants.js';
import { normalizeMode, DEFAULT_MODE, MODE_FULL, MODE_PLAN } from './permission-mode.js';
/** 等待人工决策的默认上限。调用方应保证它**明显小于**自己的杀进程上限,
* 否则会在正要给出结论的瞬间被杀掉,而「不表态」与「来不及答」就分不开了。 */
export const DEFAULT_WAIT_MS = 540000;
/** 当前档位(来自驱动注入的环境变量)。 */
export function tierOf(env = process.env) {
return normalizeMode(env.AGENTMAIL_PERMISSION_MODE) || DEFAULT_MODE;
}
/**
* 「有没有本地界面可以让人就地决定」。
*
* 判据是驱动有没有注入会话 id邮件驱动的会话由驱动起、没有界面
* 人自己开着 ZCode 时有界面。这个区分决定了暂时失败该 fail closed 还是让位。
*/
export function hasLocalUi(env = process.env) {
return !String(env.AGENTMAIL_SESSION_ID || '').trim();
}
/** 等 SSE 建连完成(服务端在 AddClient 时立刻下发一个 connected 事件)。 */
function waitConnected(state, timeoutMs = 5000, log = () => {}) {
return new Promise(resolve => {
const timer = setTimeout(() => {
log('SSE 建连等待超时,仍然继续(可能错过极早到达的决策)');
resolve();
}, timeoutMs);
state.onConnected = () => {
clearTimeout(timer);
resolve();
};
});
}
/**
* 幂等键必须**每次调用都不同**。
*
* 这里踩过一个真坑,而且失败方式极隐蔽:键取成 `会话 + 工具` 之后,
* 同一个会话里**第二次** `run_command` 就是个「重复请求」——网关按设计
* 返回 HTTP 200 `{status:"duplicate_relay", detail:"该权限询问已转发过,本次调用未产生新邮件"}`
* 并且**提前返回**:不建请求、不发邮件、永远不会有人来决策。
*
* 于是工具干等(实测被 MCP 的 30 秒调用超时砍掉),模型回报
* 「30 秒内未获批准」—— 看上去像人没理它,实际是**请求根本没出去**。
* 而 HTTP 还全是 200从状态码上看不出任何异常。
*
* 所以键的语义是「**这一次调用**」(一次工具调用 = 一次询问),不是「这个会话的这个工具」。
* 重复请求的去重需求由「一直同意」表承担(那张表是按 会话+工具 生效的,那是对的语义)。
*/
export function relayKeyForCall({ seed, sessionId, toolName, nonce }) {
const head = seed || `${sessionId || 'zcode'}:${toolName}`;
const tail = nonce || randomUUID().slice(0, 8);
return clampRelayKey(`${head}:${tail}`);
}
/** 网关在幂等命中时的回包形状(实测):建请求被跳过,不会有任何人来决策。 */
export function isDuplicateRelay(res) {
return Boolean(res && typeof res === 'object' && res.status === 'duplicate_relay');
}
/**
* 询问人类。
*
* @param {object} opts
* @param {any} opts.client 网关客户端(要 authHeaders / post / baseURL
* @param {string} opts.toolName 工具名(同时用作「一直同意」的授权粒度)
* @param {string} opts.question 给人看的问题
* @param {string} opts.context 给人看的上下文(命令内容/文件路径等)
* @param {string} [opts.sessionId] AgentMail 会话 id
* @param {string} [opts.relayKeySeed] 幂等键前缀(默认 session:tool每次调用会**追加一个随机尾**
* 见 relayKeyForCall 的注释
* @param {string} [opts.nonce] 仅测试用:固定随机尾以便断言
* @param {object} opts.grants createFileGrantStore 的实例(可省)
* @param {string} [opts.tier] 档位(默认从环境读)
* @param {number} [opts.waitMs]
* @param {Function} [opts.log]
* @param {Function} [opts.createSSE] 供测试注入
* @returns {Promise<{allowed:boolean, reason:string, decidedBy:string, via:string}>}
* via 说明结论来自哪一步tier / grant / human / permanent-failure /
* timeout / transport —— 日志与回信要能看出「当时凭什么放行」。
*/
export async function requestApproval(opts) {
const {
client,
toolName,
question,
context = '',
sessionId = '',
relayKeySeed,
nonce,
grants = null,
tier = tierOf(),
waitMs = DEFAULT_WAIT_MS,
log = () => {},
createSSE = createSSEClient
} = opts;
// ① 档位plan 档只允许读与查,没什么可问人的(该档语义就是「不动手」)。
if (tier === MODE_PLAN) {
return {
allowed: false,
via: 'tier',
decidedBy: '',
reason:
`plan 档下不允许执行 ${toolName}。本档只允许读与查,请把方案写在回信里。` +
`如需动手请让发件人把档位改成 workspace。`
};
}
// ② full 档:发件人已声明全权。这一档的核心语义就是免掉询问。
if (tier === MODE_FULL) {
return { allowed: true, via: 'tier', decidedBy: '', reason: `${tier} 档:全权,无需询问` };
}
const scope = sessionId || '';
// ③ 「一直同意」:钩子是短命进程,所以这张表由文件承载(见 grants-file.mjs
if (grants && grants.isGranted(scope, toolName)) {
return { allowed: true, via: 'grant', decidedBy: '', reason: `本会话的 ${toolName} 已获「一直同意」` };
}
const relayKey = relayKeyForCall({
seed: relayKeySeed,
sessionId: scope,
toolName,
nonce
});
// 有没有本地界面:由**调用方给的会话 id** 判定(单一事实来源)。
// 邮件驱动的会话一定带 sessionId人自己开着 ZCode 时没有。
const mailDriven = scope.trim() !== '';
// ④ 先订阅再发请求(顺序不能反,见文件头注释)。
const state = { onConnected: null };
let waiter = null;
const early = [];
const sse = createSSE({
authHeaders: () => client.authHeaders(),
baseURL: client.baseURL,
path: '/api/v1/events/stream',
log,
onEvent: (evt, data) => {
if (evt === 'connected' && state.onConnected) state.onConnected();
if (evt !== 'permission_decision') return;
// 只认自己那条:同一 Agent 可能同时有多个调用在等(模型并行发起两个动作),
// 按 relay_key 配对才不会互相拿到对方的决定。
if (data?.relay_key && data.relay_key !== relayKey) return;
if (waiter) {
const w = waiter;
waiter = null;
w(data);
} else {
early.push(data);
}
}
});
try {
await waitConnected(state, 5000, log);
try {
const accepted = await client.post('/permission/request', {
question,
options: ['同意', '一直同意', '拒绝'],
context,
session_id: scope,
relay_key: relayKey
});
// 幂等命中 = 请求**没有**发出去,永远不会有决策事件。
// 不把它当成失败的话,调用方会一直等到被客户端杀掉,而错误信息是
// 「没有人批准」—— 归因完全错了。所以当场以可读的原因拒绝。
if (isDuplicateRelay(accepted)) {
log(`授权询问被网关判为重复relay_key=${relayKey}),本次没有产生新请求`);
return {
allowed: false,
via: 'duplicate-relay',
decidedBy: '',
reason:
`授权请求被网关当作重复请求丢弃了(${accepted.detail || 'duplicate_relay'})。` +
`这意味着**没有人会看到这次询问**,因此不放行。` +
`请重新发起(键每次调用都不同),或改用不需要授权的方式。`
};
}
} catch (e) {
// 永久失败409 无人可问 / 4xx不会因重试而改变 → 当场拒绝,
// 让调用方从错误里看到原因并自己改道(挂死时连重试机会都没有)。
if (isPermanentFailure(e)) {
const b = e?.body && typeof e.body === 'object' ? e.body : {};
const reason = [b.error || `权限询问无法送达HTTP ${e?.status}`, b.detail || '', b.suggestion || '']
.filter(Boolean)
.join('\n');
log(`权限询问永久失败,当场拒绝 ${relayKey}${reason.split('\n')[0]}`);
return { allowed: false, via: 'permanent-failure', decidedBy: '', reason };
}
const detail = e?.message || String(e);
log(`权限询问暂时失败:${detail}`);
if (mailDriven) {
// 邮件驱动:没有本地界面兜底,退回本地决策等于守卫消失。
return {
allowed: false,
via: 'transport',
decidedBy: '',
reason:
`无法把 ${toolName} 的授权请求送达给人(${detail})。` +
`这条会话由邮件驱动、没有本地界面,因此不放行。` +
`请改用不需要授权的方式完成,或在回信里说明需要人工执行哪一步。`
};
}
return { allowed: false, via: 'transport', decidedBy: '', reason: `授权询问失败:${detail}` };
}
const decision =
early.shift() ??
(await new Promise(resolve => {
waiter = resolve;
setTimeout(() => {
if (waiter !== resolve) return;
waiter = null;
resolve(null);
}, waitMs);
}));
if (decision === null) {
return {
allowed: false,
via: 'timeout',
decidedBy: '',
reason: `等待授权超时(${Math.round(waitMs / 1000)} 秒内没有人决策),未执行 ${toolName}`
};
}
const text = decision.decision ?? '';
if (isApproval(text)) {
if (isAlwaysDecision(text) && grants?.grant(scope, toolName, text)) {
log(`记下「一直同意」:会话 ${scope}${toolName} 后续免批`);
}
return {
allowed: true,
via: 'human',
decidedBy: decision.decided_by || '',
reason: `获批(${text}`
};
}
return {
allowed: false,
via: 'human',
decidedBy: decision.decided_by || '',
reason: [
`用户拒绝了这次 ${toolName} 调用。`,
decision.note ? `说明:${decision.note}` : '',
decision.decided_by ? `(由 ${decision.decided_by} 决定)` : ''
]
.filter(Boolean)
.join('\n')
};
} finally {
sse.stop();
}
}