mirror of
https://gitcode.com/JianFeeeee/HomeAgent.git
synced 2026-09-21 09:28:14 +00:00
用户指出 remotedevice 的能力应当 outputch 化。查证后发现比"应当"更严重:
设备方向**根本没有出站实现**。
## 查到的三个缺口
1. `devicectlDevice` 一直声明 `OutputCapabilities() = CapStructured`(对外宣称可作输出目标),
但 `Execute` 的 switch 里**没有 "output" 分支** ⇒ `output_send__devicectl` 必然拿到
`unknown device tool output`,回模型"通过 [devicectl] 通道发送失败"。
2. 全插件没有 `RegisterOutputChannel`,也没有任何 EmitOutput/output_send 路径:
设备方向只有「工具(请求-响应)」与「设备→agent 注入」,**agent → 设备是断的**
(唯一的下行通道是个 HTTP 端点 `/api/v1/device/push`,不在 agent 的工具/通道模型里)。
3. 寻址是聚合的:所有设备共用一个名字 `devicectl`,没有 `device/<id>`;且设备 caps 只在
插件内部软检查(`SupportsTool`),**绕过**了内核的 `AllowedOutputs` 授权闸 ——
驻留子只要拿到 `device_ctl_cmdrun` 就能指挥**任意**设备。
## 按方向切分(不是一刀切)
**出站/消息类 → 每设备一个输出通道 `device/<id>`**(与入站同名):
- 上线注册、掉线注销(caps 由设备声明的 caps 映射:文本恒有;有屏→图/文件;
speaker→音频;可跑命令(cmd/cmdrun/cmdresult)或未声明已知能力→全能力,与
`deviceSupportsTool` 的旧设备兼容规则一致)。断连不注销会留下死通道骗模型。
- 于是自动获得:内核按 caps 在**发送前**拦(送图给纯文本音箱直接拒);
`output_list_channels` 能列出设备;`AllowedOutputs` 可按设备收窄给驻留子。
- 上下线钩子用 `Registry.SetPresenceHandler`(**同步回调**)而不是既有的 `ChangeChan`
(那是 select+default,缓冲满会丢事件;丢一次就留下死通道或漏注册)。
- `devicectl` 保留为聚合通道,并把它"声明了却不实现"的 output 补实:按
`meta.device_id`(或 meta 就是设备 id / args.device_id)路由;缺省时返回**可执行**的
报错(列出在线设备),而不是含糊失败。
**RPC 类保留为工具**(`devicedetect`/`screensee`/`computeruse`/`clipboard*`/
`device_ctl_status|cmdrun|cmdresult`):它们的返回值(图像/命令输出/状态)必须进模型
上下文,做成通道会丢掉这个语义。
**并给设备指令类工具补上同一道授权闸**(core/toolcall.go):`device_id` 指向的设备
必须是本 agent 被授权的 `device/<id>`。根 agent 默认完整授权 ⇒ 无行为变化;
驻留子收窄后,"拿到工具就能指挥任意设备"的缺口被堵上(新增 3 条 core 测试钉住)。
**设备端参考实现**(`internal/devicebridge/client/bridge.go` + waiter):新增 `op=push`
分发与 `OnPush` 回调(文本/结构化;二进制走既有 `cmd_speech_*` → `DataHandler`),
waiter 把它打到终端。
## 设计口径(用户当场纠偏,已写进代码注释与 harness README)
**主动转发只有 webui 与 cli 两个交互界面**(webui 订阅 EventAgentOutput 渲染气泡、
cli 用同步回程写回终端)。其它通道一律要求 agent **显式** `output_send__<通道>`。
我第一版给 remotedevice 加了 `EventAgentOutput` 订阅来自动回投设备——那是凭空造了
第三个转发者,违背"输出是 agent 的主动调用",已撤回(该测试一并删除)。
## 验收
- 单测:caps 映射词表;设备上线→注册通道(含同名 inputch)/掉线→注销;push 真落到
WS 设备;聚合通道 `devicectl` 的寻址(无 device_id 报可执行错误、按 meta 投递、
指定不存在设备报错);core 授权闸 3 例。
- 全量 `go test ./...` = 37 包 ok / 0 FAIL;`-race`(agent/plugins/plugin/devicebridge/sdk)干净。
- **真二进制端到端**(私有 netns + mock LLM + 真 WS 设备客户端 scripts/kernel-stress/devclient.py):
设备上线 → 通道表出现 `device/pydev-1`(caps=[text file image audio structured],由
`caps:["cmd"]` 映射)→ agent 经 `output_send__device/pydev-1` 主动发送 → 设备收到
`{"op":"push","payload":"内核推给你的消息","type":"text"}` → 设备掉线 → 通道从表中消失。
内核二进制压力测试(kernel-stress)
对本仓库编译出来的真实内核做压力测试 —— 与 go test 的区别是:它跑真二进制、
真插件加载、真 unix socket 协议,因此能抓到只在集成面上出现的问题
(已有战绩:根 agent DataDir 漏接线、插件通道没登记为 inputch、create 后子不开工)。
为什么必须放在私有 netns 里
生产实例占着 *:8080 / *:9890 / *:9876,而插件的监听都设了 SO_REUSEADDR:
同机再起一个实例会在 127.0.0.1 上与之并存绑定(实测抢到过 127.0.0.1:9890 约 1 分钟)。
unshare -n 后实例只有 lo,结构上不可能碰到生产端口。
unix socket 是文件系统对象,跨 netns 仍可驱动,所以驱动脚本在 netns 外也能用。
前置
go build -o /tmp/homed-stress ./cmd/homed # 被压的内核
export GOCACHE=/tmp/gocache GOPATH=/tmp/gopath TMPDIR=/var/tmp/gotmp
用法
# 1) 准备数据目录 + 把 LLM 指向本地 mock(无外网也能跑,且快、可控)
DATA=/var/tmp/kstress
mkdir -p $DATA
# 先跑一次实例建出 config.db,再写入下面这些键(也可直接复用现成目录):
# core.llm.provider=mock
# core.llm.sources.mock.base_url=http://127.0.0.1:9099/v1
# core.llm.sources.mock.model=mock api_key=mock adapter=openai
# core.llm.sources.mock.adapter_path=adapters/openai.lua priority=100
# core.defaults.llm_endpoints=http://127.0.0.1:9099/v1/models # 探活端点(探活用 HEAD!)
# core.defaults.rollback.max_retries=100000 auto_rollback=false
# 并把 core.llm.sources.deepseek* 删掉(netns 里它不可达,会让 agent 被判 degraded → rollback 循环)
# 2) 起 mock LLM + 内核(都在同一个私有 netns 里)
MOCK_DELAY_MS=300 MOCK_CHUNKS=8 ./launch.sh /tmp/homed-stress
# 3) 取认证密钥(cli 插件回落到 webui.api_key)
export KCLI_KEY=$(sqlite3 $DATA/config.db "select value from config_webui where key='api_key';")
# 4) 压
./kcli.py $DATA/cli.sock stats full # 看内核状态(含 scheduler 计数)
./stress.py $DATA/cli.sock "$KCLI_KEY" 16 12 4 20 dense 0.05 # 16 连接×12 输入 + 4 线程×20 中断
./stress.py $DATA/cli.sock "$KCLI_KEY" 12 12 1 25 0.0 3.0 # 稀疏中断 ⇒ 压抢占/挂起/恢复
./stress.py $DATA/cli.sock "$KCLI_KEY" 1 1 0 0 resident 0.0 # 驻留子全链路(mock 见 !resident 标记)
远程设备(agent ↔ 设备)端到端
设备网关在实例的 netns 内监听 127.0.0.1:9890,所以设备客户端要进同一个 netns 跑:
TOKEN=$(sqlite3 $DATA/config.db "select value from config_remotedevice where key='ws_token';")
nsenter -t $(cat $DATA/pid) -n python3 ./devclient.py --port 9890 --token "$TOKEN" \
--id pydev-1 --caps cmd --seconds 30 --out /var/tmp/push.txt
然后让 agent 主动发一条(mock 里 !push 会回一个 output_send__device/pydev-1 的工具调用):
# 经 CLI socket 发 "!push",设备侧应收到 {"op":"push", ...}
设备上线/下线会在内核里登记/注销输出通道 device/<id>,可用 /kernel 的 channels 观察
(在线时出现、掉线后消失)。
设计口径:agent → 设备必须是 agent 的主动调用(
output_send__device/<id>); 设备的上报(op=event)虽然会被注入成输入,但 agent 的回复不会被插件自动转回设备 —— 全仓只有 webui 与 cli 两个交互界面"主动转发"(把最终回复渲染成气泡/终端输出), 其它通道(qq、设备等)一律要求显式output_send__<通道>。
读结果
| 指标 | 含义 |
|---|---|
executed / rejected |
任务执行数 / 被拒数(压力下应为 0) |
峰值 峰值_队列 / 峰值_待处理中断 |
采样到的最大排队深度 / 待处理中断数 |
suspended / resumed / preempted |
抢占三件套。中断要放稀才会打在高优先级任务上:密集中断会互相同级(L4 vs L4)不抢占,数值会很低 |
max_suspend_depth |
中断栈结构上界(= 中断级数 4) |
已知坑
- 探活用 HEAD(
internal/network/monitor.go):mock 必须实现do_HEAD,否则 501 → 判不可达 → agent degraded → rollback 循环(会 reset 合并目录)。 - CLI 协议每条连接串行处理(
handleChat阻塞到本次响应产出):单连接狂发只会排成一条线,造不出队列压力 —— 必须多连接。 - 认证:连接后先发
/auth <key>,否则一切命令返回unauthorized。 mockllm.py的!resident/!notify标记用来让 mock 回工具调用,从而在真内核里驱动resident_agents/notify_parent。