mirror of
https://gitcode.com/JianFeeeee/HomeAgent.git
synced 2026-09-21 09:28:14 +00:00
此前三段式拆分后 ONNX 路径从未从 Go 侧跑通:embedder_onnx_test.go 仍引用 分段前的 API(e.renderInput、TextTower.onnx、旧目录),go vet -tags onnxruntime 直接编译失败。导出脚本只在 /tmp 且硬编码本机路径、从第三个目录拷贝固定形状的 Vision.onnx,完全不可复现。音频会被视觉塔编码,静默往统一空间灌入错误坐标。 本提交补齐这些缺口: 一、可复现导出脚本(scripts/export_qwen3vl_embedding_onnx.py) - 自动拉取模型(HuggingFace 优先,失败回落 ModelScope,支持 HF_ENDPOINT 镜像); - 导出 TokenEmbedding + Transformer + Vision 三段图,图文共用同一 token embedding、28 层 Transformer、last-token 池化与 fingerprint; - 双重自检(不可省):分段 PyTorch vs 完整模型 + 导出后的 ONNX vs 完整模型, cos < 0.999999 即非零退出——「能加载」不等于「算得对」; - 默认把 L2 归一化后的冻结参考向量写入产物目录(qwen_reference.json)—— Go 测试据此做逐维冻结回归,且「该目录是哪次导出的」从文件本身可追溯; - --verify-only 校验既有产物不重新导出,可用来确认线上在用的图没坏。 关键实测结论(已写入 docs/zh/multimodal-space.md 与长期记忆): 原生多帧视频不可行——Qwen3-VL 视觉塔把 grid_thw 当 Python 值消费 (grid_thw.tolist()),legacy tracer 固化为常量,导出后图中根本没有 grid_thw 输入,换帧数调用直接 Invalid input name: grid_thw。故视觉塔固定 (1,48,48), 视频由上层抽帧后逐帧按图像编码(同模型/同维度/同 fingerprint),音频明确 unsupported。 二、模态边界(vector.ErrModalityUnsupported) - 新增 vector.ErrModalityUnsupported:表示「该模态不在本统一空间的原生覆盖 范围内」,与普通错误语义不同——调用方应把它当「永远不会有向量」而非 「本次失败、下次重试」; - qwen.EmbedImageDense 按 mime 拒绝 audio/* 与 video/*:此前它会拿视觉塔 去解音频字节,往统一空间灌入语义错误的坐标且静默; - reembedStaleMedia 对 ErrModalityUnsupported 不计失败、不重试、不用别的 模型向量顶替(TestReembedStaleMedia_SkipsUnsupportedWithoutFaking 守住)。 三、Go ONNX 测试首次完整通过 - 重写 embedder_onnx_test.go:修复编译 + 文本冻结回归 + 图像冻结回归 + 两条阴性对照(不同输入必须不同、图像与文本必须不同)+ 不支持模态断言; - 参考值从产物目录的 qwen_reference.json 读取(不在测试里硬编码浮点); - 用线上部署产物实测全部通过(text cos=0.999999940, image cos=0.999999762)。 四、.gitignore 修复 - /scripts/ 此前被列在「运行时产物」下,但它是作者维护的工具目录 (模型导出、侧车、部署校验),deploy/systemd/embed-sidecar.service 直接 引用 scripts/embed_sidecar.py,忽略它会让那份 unit 在别人的机器上指向 不存在的文件。改为只忽略 __pycache__。 五、文档(docs/zh/multimodal-space.md) - 获取/启用/产物契约/模态边界/验证/资源成本/与现有部署产物的等价性。 验证:go build ./...、go vet ./...、go vet -tags onnxruntime ./...、 go test -short 全部通过;ONNX 标签测试对线上部署产物全部通过。
188 lines
5.8 KiB
Go
188 lines
5.8 KiB
Go
package core
|
||
|
||
import (
|
||
"context"
|
||
"fmt"
|
||
"path/filepath"
|
||
"strings"
|
||
"testing"
|
||
|
||
"gitcode.com/JianFeeeee/HomeAgent/internal/memory"
|
||
"gitcode.com/JianFeeeee/HomeAgent/internal/memory/document"
|
||
"gitcode.com/JianFeeeee/HomeAgent/internal/memory/media"
|
||
"gitcode.com/JianFeeeee/HomeAgent/internal/memory/vector"
|
||
)
|
||
|
||
// 媒体与记忆块的生命周期测试。
|
||
//
|
||
// 媒体没有独立生命周期管理(没有 GC、没有引用计数):blob 是记忆块的内容,
|
||
// 块的创建/迁移/删除由记忆系统决定。图片也不靠文本描述索引。
|
||
|
||
func newMediaLoopAgent(t *testing.T) (*Agent, *media.Store) {
|
||
t.Helper()
|
||
dir := t.TempDir()
|
||
ms, err := media.New(filepath.Join(dir, "media"))
|
||
if err != nil {
|
||
t.Fatalf("media.New: %v", err)
|
||
}
|
||
t.Cleanup(func() { ms.Close() })
|
||
|
||
a := &Agent{mediaStore: ms}
|
||
a.ctx, a.cancel = context.WithCancel(context.Background())
|
||
t.Cleanup(a.cancel)
|
||
return a, ms
|
||
}
|
||
|
||
// heldMediaDigests 汇总三层记忆持有的媒体:只有这些才可被召回。
|
||
func TestHeldMediaDigests_CollectsAcrossLayers(t *testing.T) {
|
||
a, ms := newMediaLoopAgent(t)
|
||
d1, _ := ms.Put([]byte("ctx-layer"), media.Item{MIME: "image/png"})
|
||
d2, _ := ms.Put([]byte("doc-layer"), media.Item{MIME: "image/png"})
|
||
d3, _ := ms.Put([]byte("graph-layer"), media.Item{MIME: "image/png"})
|
||
d4, _ := ms.Put([]byte("orphan"), media.Item{MIME: "image/png"})
|
||
|
||
a.context = NewRelevanceContext("", memory.NewStaticEmbedder(""))
|
||
a.context.Append(ContextEvent{Input: "带图的一轮", Blocks: []memory.MemoryBlock{
|
||
{ID: "blk_ctx", Modality: memory.BlockImage, PayloadDigest: d1},
|
||
}})
|
||
|
||
dir := t.TempDir()
|
||
bo, ok := a.blockFromDigest(d2)
|
||
if !ok {
|
||
t.Fatal("blockFromDigest 失败")
|
||
}
|
||
ds := document.NewStore(filepath.Join(dir, "docs"), memory.TokenizeWords)
|
||
if err := ds.Start(); err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
defer ds.Stop()
|
||
if err := ds.Insert(&document.Doc{ID: "doc_1", Summary: "s", Blocks: []memory.MemoryBlock{bo}}); err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
a.docStore = ds
|
||
|
||
g, err := memory.NewGraphDB(filepath.Join(dir, "graph.db"))
|
||
if err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
defer g.Close()
|
||
if err := g.PutMemoryBlocks([]memory.MemoryBlock{
|
||
{ID: "blk_g", Modality: memory.BlockImage, PayloadDigest: d3},
|
||
}); err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
a.memory = g
|
||
|
||
held := a.heldMediaDigests()
|
||
for _, want := range []string{d1, d2, d3} {
|
||
if !held[want] {
|
||
t.Errorf("层次持有 %s 却不在结果里: %v", shortDigest(want), held)
|
||
}
|
||
}
|
||
if held[d4] {
|
||
t.Errorf("无人持有的 %s 不该出现在结果里", shortDigest(d4))
|
||
}
|
||
}
|
||
|
||
// fakeSpace 是一个只覆盖图像的假统一空间,用来验证「不在本空间」与
|
||
// 「本次失败」必须被区分对待。
|
||
type fakeSpace struct{}
|
||
|
||
func (fakeSpace) VectorizeDense(string) ([]float64, error) { return []float64{1, 0}, nil }
|
||
|
||
func (fakeSpace) EmbedImageDense(_ []byte, mime string) ([]float64, error) {
|
||
if strings.HasPrefix(mime, "audio/") || strings.HasPrefix(mime, "video/") {
|
||
return nil, fmt.Errorf("%w: %s", vector.ErrModalityUnsupported, mime)
|
||
}
|
||
return []float64{1, 0}, nil
|
||
}
|
||
|
||
func (fakeSpace) Fingerprint() string { return "fake-space" }
|
||
func (fakeSpace) Dim() int { return 2 }
|
||
func (fakeSpace) Loaded() bool { return true }
|
||
func (fakeSpace) Close() {}
|
||
|
||
// TestReembedStaleMedia_SkipsUnsupportedWithoutFaking 验证向量迁移不会:
|
||
// - 把音频当失败反复重试;
|
||
// - 更不能拿另一个模型的向量顶替音频(那会污染统一空间且静默)。
|
||
func TestReembedStaleMedia_SkipsUnsupportedWithoutFaking(t *testing.T) {
|
||
a, ms := newMediaLoopAgent(t)
|
||
img, _ := ms.Put([]byte("img-bytes"), media.Item{MIME: "image/png"})
|
||
aud, _ := ms.Put([]byte("aud-bytes"), media.Item{MIME: "audio/wav"})
|
||
|
||
a.multimodalSpace = fakeSpace{}
|
||
a.reembedStaleMedia()
|
||
|
||
it, err := ms.Stat(img)
|
||
if err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
if len(it.Vec) != 2 || it.VecModel != "fake-space" {
|
||
t.Fatalf("图像应拿到本空间向量,实际 vec=%v model=%q", it.Vec, it.VecModel)
|
||
}
|
||
|
||
audIt, err := ms.Stat(aud)
|
||
if err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
if len(audIt.Vec) != 0 || audIt.VecModel != "" {
|
||
t.Fatalf("音频不得被写入任何向量(不能用别的模型顶替),实际 vec=%v model=%q",
|
||
audIt.Vec, audIt.VecModel)
|
||
}
|
||
}
|
||
|
||
// payloadHeld 是删除前的活查询。
|
||
func TestPayloadHeld(t *testing.T) {
|
||
a, ms := newMediaLoopAgent(t)
|
||
d, _ := ms.Put([]byte("held"), media.Item{MIME: "image/png"})
|
||
if a.payloadHeld(d) {
|
||
t.Fatal("尚无块持有时不该报已持有")
|
||
}
|
||
|
||
a.context = NewRelevanceContext("", memory.NewStaticEmbedder(""))
|
||
a.context.Append(ContextEvent{Input: "x", Blocks: []memory.MemoryBlock{
|
||
{ID: "blk_1", Modality: memory.BlockImage, PayloadDigest: d},
|
||
}})
|
||
if !a.payloadHeld(d) {
|
||
t.Fatal("L0 持有却报未持有")
|
||
}
|
||
if a.payloadHeld("") {
|
||
t.Fatal("空 digest 应为 false")
|
||
}
|
||
}
|
||
|
||
// TestForgetPayloads_DeletesOnlyUnheldContent 验证删除语义:
|
||
// 块被删除后内容才被删;仍被其它记忆块共享的 digest 不会被误删。
|
||
func TestForgetPayloads_DeletesOnlyUnheldContent(t *testing.T) {
|
||
dir := t.TempDir()
|
||
ms, err := media.New(filepath.Join(dir, "media"))
|
||
if err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
defer ms.Close()
|
||
|
||
d1, _ := ms.Put([]byte("held-by-graph"), media.Item{MIME: "image/png"})
|
||
d2, _ := ms.Put([]byte("being-forgotten"), media.Item{MIME: "image/png"})
|
||
|
||
g, err := memory.NewGraphDB(filepath.Join(dir, "graph.db"))
|
||
if err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
defer g.Close()
|
||
if err := g.PutMemoryBlocks([]memory.MemoryBlock{
|
||
{ID: "blk_keep", Modality: memory.BlockImage, PayloadDigest: d1},
|
||
}); err != nil {
|
||
t.Fatal(err)
|
||
}
|
||
|
||
a := &Agent{mediaStore: ms, memory: g}
|
||
a.forgetPayloads([]string{d1, d2})
|
||
|
||
if _, err := ms.Stat(d1); err != nil {
|
||
t.Fatalf("仍被 L3 块持有的内容不该被删: %v", err)
|
||
}
|
||
if _, err := ms.Stat(d2); err == nil {
|
||
t.Fatal("无人持有的内容应被删除")
|
||
}
|
||
}
|