mirror of
https://gitcode.com/JianFeeeee/HomeAgent.git
synced 2026-10-04 00:03:59 +00:00
feat: 完整实现 NLP 三元组提取系统 + token budget 上下文分配
- 重写 extractor.go: 分句、17条 POS 模板、依存模板 + COO 链、ATT合并 - parser.go: 分句循环 + TransE 向量验证(h+r≈t) - fallback.go: jieba POS 降级解析器 - bridge.go: nlp.Triple ↔ memory.Triple 转换 - pipeline.go: extractKeyTriples 改用 NLP 提取器, 删除5条旧前缀规则 - distill.go: docToTriples 改用 NLP 提取器 - reorgGraph: 语义相似度增强检测, 保持纯 LLM 决断 - Provider 接口加 MaxContextTokens() + 模型窗口映射表 - tokenbudget.go: 中文 token 估算器 + budget 分配(80%利用率) - process.go/buildSystemPrompt: 按 token 预算截断 memory+timeline
This commit is contained in:
@ -121,21 +121,31 @@ func (s *Store) All() []DocVector {
|
||||
return out
|
||||
}
|
||||
|
||||
// TFIDFVectorizer 使用字符 bigram + TF-IDF
|
||||
type TFIDFVectorizer struct {
|
||||
mu sync.RWMutex
|
||||
docFreq map[string]float64 // feature → 文档频率
|
||||
totalDocs int
|
||||
maxNGram int
|
||||
// Tokenizer 将文本拆分为词级 token
|
||||
type Tokenizer func(string) []string
|
||||
|
||||
// NGramTokenizer 创建字符 n-gram tokenizer(降级方案)
|
||||
func NGramTokenizer(maxN int) Tokenizer {
|
||||
return func(text string) []string {
|
||||
return extractNGrams(text, maxN)
|
||||
}
|
||||
}
|
||||
|
||||
func NewTFIDFVectorizer(maxNGram int) *TFIDFVectorizer {
|
||||
if maxNGram <= 0 {
|
||||
maxNGram = 2
|
||||
// TFIDFVectorizer 使用 tokenizer + TF-IDF
|
||||
type TFIDFVectorizer struct {
|
||||
mu sync.RWMutex
|
||||
tokenizer Tokenizer
|
||||
docFreq map[string]float64 // feature → 文档频率
|
||||
totalDocs int
|
||||
}
|
||||
|
||||
func NewTFIDFVectorizer(tokenizer Tokenizer) *TFIDFVectorizer {
|
||||
if tokenizer == nil {
|
||||
tokenizer = NGramTokenizer(2)
|
||||
}
|
||||
return &TFIDFVectorizer{
|
||||
docFreq: make(map[string]float64),
|
||||
maxNGram: maxNGram,
|
||||
tokenizer: tokenizer,
|
||||
docFreq: make(map[string]float64),
|
||||
}
|
||||
}
|
||||
|
||||
@ -148,7 +158,7 @@ func (v *TFIDFVectorizer) Train(docs []string) {
|
||||
|
||||
seen := make(map[string]map[string]bool)
|
||||
for _, doc := range docs {
|
||||
features := extractNGrams(doc, v.maxNGram)
|
||||
features := v.tokenizer(doc)
|
||||
key := doc
|
||||
if seen[key] == nil {
|
||||
seen[key] = make(map[string]bool)
|
||||
@ -166,7 +176,7 @@ func (v *TFIDFVectorizer) Vectorize(text string) Vector {
|
||||
v.mu.RLock()
|
||||
defer v.mu.RUnlock()
|
||||
|
||||
features := extractNGrams(text, v.maxNGram)
|
||||
features := v.tokenizer(text)
|
||||
tf := make(map[string]float64)
|
||||
for _, f := range features {
|
||||
tf[f]++
|
||||
|
||||
Reference in New Issue
Block a user