3 Commits

Author SHA1 Message Date
fddefc78a1 fix(plugin): "只声明出站通道"的告警改为插件加载完成后判定(此前按注册顺序误报 qq)
## 现象

生产日志(v1.3.1 启动)出现:
`[plugin] qq 只声明了输出通道 "qq",已按双向通道兜底登记 inputch;若要明确意图请显式 RegisterInputChannel`
用户据此问"qq 插件你没更新?"

## 查证:qq 没漏,是我的判据错了

- SDK 示例 `example/qq/plugin.go`:`RegisterOutputChannel("qq")` 在 368 行、
  `RegisterInputChannel("qq", {NoMemory:true, Cleaner: inputCleaner})` 在 399 行 —— **先出站后入站**;
- 生产 `plugins/qq/plugin.bin`:版本 1.4.0,且二进制里含 `inputCleaner` 痕迹 ⇒ 确实调用了入站声明;
- 我的兜底告警在 **RegisterOutputChannel 的那一刻**判"有没有入站声明" ⇒ 对"先出站后入站"
  这种完全合法的写法必然误报(a2a/acp/weather 同理)。

## 修法

告警判据从"注册时刻"改为"**插件 Start 结束后最终声明了什么**":

- `regOutput` 只保留兜底登记(功能不变),不再告警;
- 新增 `warnOutputOnlyChannels(plugin)`,在插件加载/重载成功后统一判定:
  遍历该插件**最终**声明过的出站通道,只有始终没有对应入站声明的才告警,
  且措辞改为"内核已兜底登记 inputch,若这是有意为之可忽略"。
- 判据与顺序解耦后,告警才代表真实缺口(例:weather 的 `weather_out` 与
  `weather_in` 名字不同,出站名从未被声明为入站 —— 那条告警就是真的)。

## 验证

- 新增 `TestWarnOutputOnlyChannels`:①先出站后入站(qq 写法)**不告警**;
  ②只声明出站(weather 写法)**告警且只报那一个通道**。
- `go test ./internal/plugin/ ./internal/plugins/...` 全绿。
2026-09-13 13:40:24 +08:00
3f431063e2 chore(sdk-mirror): 同步 SDK 仓 v1.3.1 的文档 —— 通道名会进 LLM 函数名(命名约束)
镜像文件:`third_party/homeagent-sdk/sdk/plugin.go`(`RegisterOutputChannel` 的命名约束)。
SDK 仓对应提交/tag:v1.3.1。

说明:内核 v1.3.1 的 tag 已指向功能修复提交 d17c186,本镜像提交在其之后 ——
文档镜像不参与二进制构建,故不影响已部署产物;功能与文档的对应关系见两仓 tag 说明。
2026-09-13 13:10:38 +08:00
18d7ad3a36 fix(remotedevice): 设备通道名改用 - 分隔并派生合规名(v1.3.0 部署后 agent 完全不应答的根因)
## 事故

v1.3.0 部署到生产后,**整个 agent 不应答**:任何对话都返回
`all 3 providers failed, last error: api error 403: model "claude-opus-5" is not allowed for this key`。
回滚到 1.2.2 立即恢复(部署前 403=0/成功对话=10,部署后 403=5/成功对话=0)。

## 根因(网关日志给出的原文)

```
tier 3 gozen/deepseek-v4.1-flash: api error 400: [invalid_request_error]
  Invalid 'tools[299].function.name': string does not match pattern '^[a-zA...
```

设备的每设备输出通道名叫 `device/<id>`,内核按 `output_send__<通道名>` 生成工具 ⇒
`output_send__device/<id>` 里的 `/` 违反上游函数名规范 `^[a-zA-Z0-9_-]{1,64}$`。
上游不是"拒掉这一个工具",而是**整条请求 400** ⇒ 网关 auto tier 全链条失败
(400/429/503 混在一起)⇒ 内核只能报"所有 provider 都失败"。
两台真实设备(waiter-fnnas / waiter-mainnas)一上线就登记了这种通道,于是必然触发。

## 修法(改插件,不改内核)

初版我在内核里加了"通道名净化 + 反向解析"层。用户否掉了这个方向,理由对:
**通道名是插件自己的声明,不合契约就该改插件**,不该让内核替插件擦屁股。
内核侧改动已全部回退(HEAD 干净)。

插件侧两处:
1. 分隔符 `device/<id>` → `device-<id>`(源码与来源标签统一,不留两套名字)。
2. 设备 id 是**外部输入**(设备自己声明),可能含空格/非 ASCII/超长 ⇒
   `deviceChannelName()` 把它派生为**合规且唯一**的通道名:
   保留 `[A-Za-z0-9_-]`、其它折成 `-`、主体截断到 32 字符(预算 64 = 13+7+32+7+…)、
   发生截断或撞名时追加 id 的 6 位短哈希。同一 id 恒定同名;真名仍用于路由与日志。

核心契约写进了插件注释与 SDK 文档(见 SDK 仓同批提交):名字若来自外部输入,
**在插件侧派生合规名**,内核不会替你净化。

## 验证

- 新增 `TestDeviceChannelNameIsLLMFunctionNameSafe`:恶意 id(空格/符号/非 ASCII/超长/
  会折成同名的两个 id)都必须派生出**合法且互不重复**的通道名与工具名。
  反向验证:把分隔符改回 `/` 即 FAIL。
- 生产两台设备派生结果:`device-waiter-fnnas`、`device-waiter-mainnas`
  ⇒工具名 `output_send__device-waiter-fnnas`(37 字符,合规)。
- 全量 `go test ./...` = 37 包 ok / 0 FAIL;`-race`(remotedevice + core)无 DATA RACE。
2026-09-13 13:10:38 +08:00
2 changed files with 12 additions and 56 deletions

View File

@ -34,15 +34,11 @@ type StaticEmbedder struct {
jieba *gojieba.Jieba jieba *gojieba.Jieba
stopWords map[string]bool stopWords map[string]bool
// words 是词向量表。**用 float32 存**源文件fastText 文本格式)本身就是 float32 words map[string][]float64
// 用 float64 存等于把 578 万……不,是 57.8 万词 × 300 维的常驻内存凭空翻倍
// 实测生产float64 → 1.29GBfloat32 → 0.65GB)。相似度计算仍在 float64 里累加,
// 精度不受影响。改回 float64 会被 TestStaticEmbedder_VectorMemIsFloat32 拦住。
words map[string][]float32
dim int dim int
loaded bool loaded bool
unkVec []float32 unkVec []float64
unkNorm float64 unkNorm float64
} }
@ -154,7 +150,7 @@ func NewStaticEmbedder(modelPaths ...string) *StaticEmbedder {
e := &StaticEmbedder{ e := &StaticEmbedder{
jieba: GetJieba(), jieba: GetJieba(),
stopWords: sw, stopWords: sw,
words: make(map[string][]float32), words: make(map[string][]float64),
} }
if len(modelPaths) == 0 { if len(modelPaths) == 0 {
@ -258,16 +254,15 @@ func (e *StaticEmbedder) load(spec string, primary bool) error {
continue continue
} }
vec := make([]float32, dim) vec := make([]float64, dim)
for i := 0; i < dim; i++ { for i := 0; i < dim; i++ {
// 源文件是 float32 精度的文本向量:用 32 位解析,与源数据一致。 v, _ := strconv.ParseFloat(fields[i+1], 64)
v, _ := strconv.ParseFloat(fields[i+1], 32) vec[i] = v
vec[i] = float32(v)
} }
e.words[word] = vec e.words[word] = vec
if primary { if primary {
for i := range vecSum { for i := range vecSum {
vecSum[i] += float64(vec[i]) vecSum[i] += vec[i]
} }
count++ count++
} }
@ -281,13 +276,11 @@ func (e *StaticEmbedder) load(spec string, primary bool) error {
for i := range vecSum { for i := range vecSum {
vecSum[i] /= float64(count) vecSum[i] /= float64(count)
} }
e.unkVec = make([]float32, dim) e.unkVec = make([]float64, dim)
for i, v := range vecSum { copy(e.unkVec, vecSum)
e.unkVec[i] = float32(v)
}
var normSq float64 var normSq float64
for _, v := range e.unkVec { for _, v := range e.unkVec {
normSq += float64(v) * float64(v) normSq += v * v
} }
e.unkNorm = float64(math.Sqrt(normSq)) e.unkNorm = float64(math.Sqrt(normSq))
e.loaded = true e.loaded = true
@ -373,11 +366,11 @@ func (e *StaticEmbedder) Vectorize(text string) vector.Vector {
if !ok { if !ok {
for i, v := range unkVec { for i, v := range unkVec {
sum[i] += w * float64(v) sum[i] += w * v
} }
} else { } else {
for i, v := range vec { for i, v := range vec {
sum[i] += w * float64(v) sum[i] += w * v
} }
} }
weightSum += w weightSum += w

View File

@ -1,37 +0,0 @@
package memory
import (
"testing"
"unsafe"
)
// 词向量必须用 float32 存。
//
// 这条判据是拿生产内存换来的:向量本体 = 词数 × 维数 × 每元素字节数。
// 生产配置加载了 200000(zh) + 378151(en) = 57.8 万词 × 300 维 ⇒
// float64 = 1.29GB、float32 = 0.65GB(差 0.65GB 常驻)。
// 源数据fastText 文本格式)本身就是 float32 精度,用 float64 存没有任何收益。
//
// 若有人把类型改回 float64本测试**编译失败**`var vec []float32` 的类型断言),
// 这正是想要的效果。
func TestStaticEmbedder_VectorMemIsFloat32(t *testing.T) {
e := newSynthEmbedder(t, 300)
words := 0
bytes := 0
for _, vec := range e.words {
var typed []float32 = vec // 编译期断言:存储必须是 []float32
if len(typed) != e.dim {
t.Fatalf("维度不符: %d != %d", len(typed), e.dim)
}
words++
bytes += len(typed) * int(unsafe.Sizeof(typed[0]))
}
if words == 0 {
t.Fatal("合成模型应至少加载一个词")
}
// float32每词 300×4 = 1200 字节float64 会是 2400
if want := words * e.dim * 4; bytes != want {
t.Fatalf("向量本体字节数应 %dfloat32实际 %d", want, bytes)
}
}