mirror of
https://gitcode.com/JianFeeeee/HomeAgent.git
synced 2026-09-25 03:18:08 +00:00
背景:此前媒体是靠「生成的描述文本」将就进记忆的——写 marker 进正文、 再由正则反解成 media_refs 与图库里的 type=Media 实体。这条链路有三个 致命缺陷:描述由异步模型生成(未生成前媒体等于不存在)、语义检索实质上 只搜描述文字、图库里的「媒体节点」是描述文本的投影而不是媒体本身。 本提交把这条链路整体拆除,媒体改为按自己的原生向量参与记忆: 一、描述链彻底删除(无残留、无兼容分支) - media.Item 去掉 Description/DescribedBy 与对应列; - 删除 Store.Describe / Store.Search / Store.Pending; - 删除 Agent.mediaDescribeLoop / describePendingMedia 与配置项 core.memory.media.describe_on_ingest; - SDK 侧 MediaAttachment 去掉 Description(见 SDK 仓独立提交)。 二、marker 机制删除,媒体归属改为结构化块边 - 删除 mediaMarkerLine/parseMediaMarkers/mediaEntityName/mediaTriplesFromText/ extractMediaDigests/sentenceWithMediaMarkers/docMediaContext; - memory.Triple 新增 MediaDigests 结构化字段;句子文本保持原样, 不再被 marker 污染; - 块以 sentence --contains--> block / document --contains--> block 结构边 挂到承载节点(新增 documents 表与 document 节点种类); - 模型未给原句时用「主谓宾。」拼一句自然语言作落点,不造 marker 文本。 三、旧数据迁移(幂等) - 新增 GraphDB.MigrateLegacyMediaEntities:把 type=Media 的旧实体按短 digest 还原成原生块、挂回原句子、删除旧实体与描述关系;Agent 启动时执行; - CleanupOrphanedSentences 同时看关系引用与块边,避免把只靠块存活的句子 连同块边一起删掉。 四、向量融合:媒体按图本身被召回 - 新增 vector.FuseVectors(逐维求和 + L2 归一化); - Doc.DenseVec = 文本向量 ⊕ 文档块的媒体向量(同 fingerprint 才融合), 新增 Doc.DenseFP,指纹变化触发重算; - ContextEvent.DenseVec 同理融合事件块;事件新增 DenseFP,Prune 只在 同一统一空间内比稠密余弦; - 跨模态视觉路只召回「仍被某层记忆块持有」的媒体,CAS 全库字节不再 直接充当记忆检索结果。 五、同时纳入本分支既有的嵌入基础改造(此前工作区未提交,缺它 HEAD 不可构建) - internal/tfidf 懒回退包、千问三段式多模态 ONNX 空间的 Go 侧 (qwen/embedder.go、image.go、model_input.go)、CLIP 移除、 sdk.NewStore 分词器签名与调用点、embed 侧车 systemd 单元。 验证:go build ./... 、go vet ./...(含 -tags medialive)均通过; 在 HEAD 的独立 worktree 上重放本次暂存集后 go test -short ./internal/... 全部通过(端口冲突类用例在隔离环境中亦通过)。未提交工作区中与本改造 无关的改动(HarmonyOS、waiter、devicebridge、plan.md 等)。
87 lines
2.5 KiB
Go
87 lines
2.5 KiB
Go
//go:build onnxruntime
|
||
|
||
package qwen
|
||
|
||
import (
|
||
"fmt"
|
||
"strings"
|
||
)
|
||
|
||
// imageModelInput 构造 Qwen3-VL 单图对话模板及对应 M-RoPE 位置。
|
||
// 固定 768×768 视觉塔产生 576 个合并后的视觉 token。
|
||
func (t *Tokenizer) imageModelInput(instruction string, maxLen int) (ids []int, attention, position []int64, visual []bool, err error) {
|
||
if instruction == "" {
|
||
instruction = DefaultInstruction
|
||
}
|
||
text := "<|im_start|>system\n" + instruction +
|
||
"<|im_end|>\n<|im_start|>user\n<|vision_start|>" +
|
||
strings.Repeat("<|image_pad|>", qwenVisualTokens) +
|
||
"<|vision_end|><|im_end|>\n<|im_start|>assistant\n"
|
||
ids, err = t.encodeModelInput(text, maxLen)
|
||
if err != nil {
|
||
return nil, nil, nil, nil, err
|
||
}
|
||
imageID, ok := t.SpecialID("<|image_pad|>")
|
||
if !ok {
|
||
return nil, nil, nil, nil, fmt.Errorf("tokenizer.json 缺少 <|image_pad|>")
|
||
}
|
||
|
||
visual = make([]bool, len(ids))
|
||
attention = make([]int64, len(ids))
|
||
position = make([]int64, 3*len(ids))
|
||
for i, id := range ids {
|
||
attention[i] = 1
|
||
visual[i] = id == imageID
|
||
}
|
||
|
||
current := int64(0)
|
||
for start := 0; start < len(ids); {
|
||
isVisual := visual[start]
|
||
end := start + 1
|
||
for end < len(ids) && visual[end] == isVisual {
|
||
end++
|
||
}
|
||
if !isVisual {
|
||
for i := start; i < end; i++ {
|
||
p := current + int64(i-start)
|
||
position[i] = p
|
||
position[len(ids)+i] = p
|
||
position[2*len(ids)+i] = p
|
||
}
|
||
current += int64(end - start)
|
||
} else {
|
||
if end-start != qwenVisualTokens {
|
||
return nil, nil, nil, nil, fmt.Errorf("qwen: image token count=%d, want %d", end-start, qwenVisualTokens)
|
||
}
|
||
side := qwenImageSize / qwenPatchSize / qwenSpatialMerge
|
||
for i := start; i < end; i++ {
|
||
j := i - start
|
||
position[i] = current
|
||
position[len(ids)+i] = current + int64(j/side)
|
||
position[2*len(ids)+i] = current + int64(j%side)
|
||
}
|
||
current += int64(side)
|
||
}
|
||
start = end
|
||
}
|
||
return ids, attention, position, visual, nil
|
||
}
|
||
|
||
// textModelInput 执行完整 tokenizer post_processor,并构造纯文本标准 RoPE 位置。
|
||
func (t *Tokenizer) textModelInput(instruction, text string, maxLen int) (ids []int, attention, position []int64, visual []bool, err error) {
|
||
ids, err = t.encodeModelInput(renderInstructionInput(instruction, text), maxLen)
|
||
if err != nil {
|
||
return nil, nil, nil, nil, err
|
||
}
|
||
attention = make([]int64, len(ids))
|
||
position = make([]int64, 3*len(ids))
|
||
visual = make([]bool, len(ids))
|
||
for i := range ids {
|
||
attention[i] = 1
|
||
position[i] = int64(i)
|
||
position[len(ids)+i] = int64(i)
|
||
position[2*len(ids)+i] = int64(i)
|
||
}
|
||
return ids, attention, position, visual, nil
|
||
}
|