fix(multimodal): 修多模态假成功 + 落地视觉回退链 + see_video 帧数语义

## 起因

生产盲测:模型调 multimodal_see_picture 后声称看到了图,实际一个字
都没收到。工具却返回「[已将图片注入后续对话]」。

链路:core.llm.model=AUTO → llmsproxy 按优先级选 big-pickle(prio=100)
→ 转 opencode zen。llmsproxy 的 opencode.lua 明写着:

    -- zen 上游 schema 只接受 text content part(无视觉/音频能力)
    if part.type ~= nil and part.type ~= "text" then  -- 丢弃

判据:256x256 纯红 PNG,带图与不带图的 prompt_tokens 都是 256。
图片贡献零 token,即根本没进上游。

内核序列化与注入链本身是对的(Message.MarshalJSON 正确产出 content
数组,SetToolBlocks → IOManager → ConsumeToolBlocks → toolMsg.Blocks
全通)。缺的是「主模型能否消费这些块」这一判断——内核此前完全没有
多模态能力的概念(grep supportsVision|multimodal 在 agent/ 零命中)。

这与 v1.0.0 修的 output_send 假成功同类:告诉调用方成功而实际未送达。

## 1. 能力声明

新增 core.llm.sources.<name>.vision / .audio(走既有 sourceFieldDefs,
WebUI 配置页自动出现),types.LLMSource 与 api.BaseConfig 同步加字段。

新增 agentAPI.ModalProvider 接口 + ProviderSupportsVision/Audio 判定:
未实现该接口的 provider 一律按不支持处理。保守侧是刻意的——宁可多走
一次文字回退,也不能把图默默扔给会剥掉它的上游。

为何是声明而非探测:探测需额外真实调用且结果不稳定(取决于 AUTO 当次
路由到哪);而 200 响应 + 相同 token 数从响应侧无法区分「看到了但没
内容」和「被剥掉了」。

## 2. 回退链(modalfallback.go)

实现了 config/registry.go 里注册但从未被读取的 image/audio
fallback_provider + fallback_model(此前 0 处读取点)。

prepareToolBlocks 在 process.go 注入前判定:能直视就原样透传;不能就
调声明了该能力的源转写成文字,带 [由 X 转写,非当前模型直接感知] 标注。

几处刻意的设计:
- 逐模态判定,不一刀切。很多视觉模型能看图但听不到音频,全部降级会
  白白把可直视的图变成二手描述
- 混合场景下转写文字作为 text 块并入 native,两部分同时到达模型
- 配置指向未声明能力的源时拒绝并继续找——照用只会重演静默剥离
- 未配 fallback_provider 但某源声明了 vision 时自动扫出来用;静默失败
  比多找一个能用的源更糟
- 空回复算失败。上游剥掉媒体后模型往往回「我没看到图片」或空串,两种
  都说明回退链也没真看到
- 多媒体块按模态合包为一次请求(见下)

## 3. 批量合包(生产实测驱动的返工)

首版逐块调用,生产 see_video 6 帧实测:4 帧里 3 帧超时,整轮 363 秒。
改为按模态合包一次请求后同一用例 131 秒、6/6 成功。

顺带把 modalFallbackTimeout 从 90s 提到 180s:生产经网关转
claude-opus-5 看一张 400x400 图要 ~81s,90s 贴着上限。
多张时 detail 默认 low 控体积,单张用 high 看细节;插件显式给了
detail 则尊重它。

## 4. see_video 帧数语义

fps=1/N 是频率(每 N 秒一帧)不是数量。20s 视频实测:
frames=4 → 5 帧、frames=10 → 2 帧、frames=1 → 20 帧,要得越多拿得越少;
长视频下 frames=4 会产出 时长/4 帧,靠 i>=9 的 break 兜着才没炸上下文,
而那个 break 用的是 ReadDir 索引,跳过条目后与实际帧数错位。

改为 ffprobe 取时长 → fps=N/时长 + -frames:v N 硬封顶。
0.4s/3s/20s/120s × frames=1/2/4/7/10 全部精确。

极短视频的坑:fps=1 在 0.4s 素材上产出 0 帧(不足一秒抽不出),所以
时长探测失败时不能退化成 fps=1,改为不传 -vf 只靠 -frames:v。

## 验证

- modalfallback_test.go 14 例:直视透传 / 回退转写 / 无源如实报告 /
  未实现接口按不支持 / 混合模态拆分 / 空回复算失败 / 块数上限 /
  多图合一次调用 / detail 策略 / 拒绝未声明能力的源 / 未配置时自动扫源
- go test ./... 全绿,go vet 无警告
- 生产盲测(答案预先封存、生成时不读):随机三色带 → 模型答
  「紫、蓝、红」,与封存答案完全一致
- 负向验证:拿掉回退源后模型如实回答「没看到图片内容」并引用工具返回
  的配置提示,且主动纠正了上一轮的答案
- 生产 see_video 6 帧:单次转写,模型正确描述测试图卡的计数器递增与
  彩虹带滚动
This commit is contained in:
JianFeeeee
2026-09-04 06:25:51 +08:00
parent 9b92a04230
commit 09071dc235
9 changed files with 935 additions and 22 deletions

View File

@ -235,6 +235,31 @@ type RoutableProvider interface {
Priority() int // AUTO 跨源选择的优先级,大者优先
}
// ModalProvider 声明自身的多模态能力。单独抽接口而不合进 Provider
// 第三方 Provider 实现无需改动,未实现时按纯文本处理(保守侧)。
type ModalProvider interface {
SupportsVision() bool
SupportsAudio() bool
}
// ProviderSupportsVision 安全判定任意 Provider 能否看图。
// 未实现 ModalProvider 的一律返回 false宁可多走一次文字回退
// 也不能把图默默扔给一个会把它剥掉的上游。
func ProviderSupportsVision(p Provider) bool {
if mp, ok := p.(ModalProvider); ok {
return mp.SupportsVision()
}
return false
}
// ProviderSupportsAudio 安全判定任意 Provider 能否听音频。
func ProviderSupportsAudio(p Provider) bool {
if mp, ok := p.(ModalProvider); ok {
return mp.SupportsAudio()
}
return false
}
// ModelContextWindow 返回模型的最大上下文窗口token 数)
// 标称窗口 ≠ 有效窗口:接近满时注意力涣散,调用方应取 70-80% 为目标利用率
func ModelContextWindow(model string) int {
@ -284,6 +309,11 @@ type BaseConfig struct {
ContextWindow int `json:"context_window"`
MaxConcurrent int `json:"max_concurrent"`
Priority int `json:"priority"`
// Vision/Audio 声明这条链路能否真正处理多模态内容块。
// 网关可能静默剥离 image_url 后仍返回 200所以不能从响应推断能力。
Vision bool `json:"vision"`
Audio bool `json:"audio"`
}
// LuaAdaptedProvider 使用 Lua 脚本做请求/响应变换,直接发起 HTTP 调用
@ -343,6 +373,11 @@ func (p *LuaAdaptedProvider) Name() string { return p.name }
func (p *LuaAdaptedProvider) Model() string { return p.cfg.Model }
func (p *LuaAdaptedProvider) Priority() int { return p.cfg.Priority }
// SupportsVision/SupportsAudio 实现 ModalProvider值来自部署时声明
// core.llm.sources.<name>.vision / .audio
func (p *LuaAdaptedProvider) SupportsVision() bool { return p.cfg.Vision }
func (p *LuaAdaptedProvider) SupportsAudio() bool { return p.cfg.Audio }
func (p *LuaAdaptedProvider) Chat(ctx context.Context, req *CompletionRequest) (*CompletionResponse, error) {
if p.cfg.Model != "" && (req.Model == "" || req.Model == "AUTO") {
req.Model = p.cfg.Model

View File

@ -0,0 +1,362 @@
package core
import (
"context"
"fmt"
"log"
"strings"
"time"
agentAPI "gitcode.com/JianFeeeee/HomeAgent/internal/agent/api"
)
// 多模态回退链:主模型看不到图/听不到音频时,改用一个声明了 vision/audio
// 能力的源把媒体转写成文字,再以 text block 注入。
//
// 为何必须有这条链core.llm.model=AUTO 时实际落到哪个上游由网关按优先级决定,
// 而网关可能把 image_url 块静默剥离后转发给纯文本上游llmsproxy 的
// opencode adapter 就明写着 "multimodal part not supported by zen" 并丢弃
// 非 text part。请求依然返回 200带图与不带图的 prompt_tokens 完全相同,
// 模型于是回答「我没有看到图片」,而内核以为注入成功。
//
// 没有这条链的话multimodal 插件在任何非视觉主模型下都只能假成功。
const (
// modalFallbackTimeout 单次转写调用的上限。
//
// 为何是 180s生产实测经网关转 claude-opus-5 看一张 400x400 图要 ~81s
// 90s 阅则定时贴着上限,多帧批量请求更慢。宁可等也不要徒劳一趟。
modalFallbackTimeout = 180 * time.Second
// modalFallbackMaxTokens 转写输出上限。描述一组图/一段音频不需要长文,
// 且这段文字要塞回主模型上下文,过长会挤掉真正的对话内容。
modalFallbackMaxTokens = 1500
// modalFallbackMaxBlocks 单次最多转写多少个媒体块。
// see_video 一次能注入 10 帧;即使批量合包,图越多上游越慢也越容易超
// 单请求体积限制。超出部分如实报告未转写。
modalFallbackMaxBlocks = 6
)
// modalFallbackResult 描述一次回退转写的结果,供调用方决定注入什么。
type modalFallbackResult struct {
// Text 是转写出的文字(已含来源标注),为空表示没有可注入内容。
Text string
// Converted 实际成功转写的块数。
Converted int
// Skipped 因超出 modalFallbackMaxBlocks 而未处理的块数。
Skipped int
// Notice 给模型看的说明(能力缺失、转写失败等),始终如实。
Notice string
}
// resolveModalFallback 按配置挑一个能处理该模态的 provider。
//
// 顺序:配置指定的 fallback_provider → 任意声明了该能力的已注册源。
// 后者是刻意的兜底:用户可能只在源上声明了 vision 而忘了填 fallback_provider
// 此时静默失败比多找一个能用的源更糟。
func (a *Agent) resolveModalFallback(kind string) (agentAPI.Provider, string) {
if a.providerManager == nil {
return nil, ""
}
var configured string
switch kind {
case "image":
configured = strings.TrimSpace(a.inputCfg.Image.FallbackProvider)
case "audio":
configured = strings.TrimSpace(a.inputCfg.Audio.FallbackProvider)
}
supports := func(p agentAPI.Provider) bool {
if p == nil {
return false
}
if kind == "audio" {
return agentAPI.ProviderSupportsAudio(p)
}
return agentAPI.ProviderSupportsVision(p)
}
if configured != "" {
p := a.providerManager.Get(configured)
if p == nil {
log.Printf("[agent] modal fallback %s: configured provider %q not registered", kind, configured)
} else if !supports(p) {
// 配置指向了一个没声明该能力的源:照用只会重演静默剥离,
// 因此拒绝并继续找,日志点明配置与声明不一致。
log.Printf("[agent] modal fallback %s: provider %q does not declare the capability, ignoring", kind, configured)
} else if !a.providerManager.IsAvailable(configured) {
log.Printf("[agent] modal fallback %s: provider %q in cooldown, trying others", kind, configured)
} else {
return p, configured
}
}
// 兜底:扫已注册源,取第一个声明了该能力且当前可用的。
for _, name := range a.providerManager.List() {
if name == configured {
continue // 上面已试过
}
p := a.providerManager.Get(name)
if supports(p) && a.providerManager.IsAvailable(name) {
return p, name
}
}
return nil, ""
}
// modalFallbackModel 返回该模态回退调用应使用的模型名(空则用源自身默认)。
func (a *Agent) modalFallbackModel(kind string) string {
switch kind {
case "image":
return strings.TrimSpace(a.inputCfg.Image.FallbackModel)
case "audio":
return strings.TrimSpace(a.inputCfg.Audio.FallbackModel)
}
return ""
}
// modalFallbackPrompt 返回转写用的提示词,配置为空时给一个可用默认。
func (a *Agent) modalFallbackPrompt(kind string) string {
switch kind {
case "image":
if s := strings.TrimSpace(a.inputCfg.Image.DescribePrompt); s != "" {
return s
}
return "请详细描述这张图片的内容,包括其中的文字、物体、人物、场景等信息。"
case "audio":
if s := strings.TrimSpace(a.inputCfg.Audio.DescribePrompt); s != "" {
return s
}
return "请转写这段音频的内容。"
}
return ""
}
// transcribeBlocksForFallback 把主模型看不懂的媒体块转写成文字。
//
// blocks 里的 text 块原样保留它们本来就能被理解image_url/audio_url
// **按模态批量合包,每类只发一次请求**。
//
// 为何必须批量而不是逐块:生产实测 see_video 注入 6 帧时,逐帧调用让
// 4 帧里 3 帧超时,整轮拖到 363 秒。而视觉模型本来就能在一条消息里看
// 多张图——一次调用不仅快上一个数量级,模型还能看到帧与帧的时间推进
// 关系,分析质量更好。
//
// 返回的 Text 已带来源标注,让模型知道这是转写而非自己直接看到的。这点
// 很重要:模型据此能判断细节可靠性,也不会在用户追问像素级细节时编造。
func (a *Agent) transcribeBlocksForFallback(blocks []agentAPI.ContentBlock) modalFallbackResult {
var res modalFallbackResult
var kept []string // 原样保留的 text 块
var converted []string // 转写结果
var notices []string
// 先按模态分组,同时应用块数上限。
var imgURLs, imgDetails []string
var audURLs []string
mediaSeen := 0
for _, b := range blocks {
switch b.Type {
case "text":
if b.Text != "" {
kept = append(kept, b.Text)
}
continue
case "image_url":
mediaSeen++
if mediaSeen > modalFallbackMaxBlocks {
res.Skipped++
continue
}
if b.ImageURL != nil && b.ImageURL.URL != "" {
imgURLs = append(imgURLs, b.ImageURL.URL)
imgDetails = append(imgDetails, b.ImageURL.Detail)
}
case "audio_url":
mediaSeen++
if mediaSeen > modalFallbackMaxBlocks {
res.Skipped++
continue
}
if b.AudioURL != nil && b.AudioURL.URL != "" {
audURLs = append(audURLs, b.AudioURL.URL)
}
default:
continue // 未知块类型:主模型也看不懂,丢弃
}
}
// 图片:一次请求带全部帧
if len(imgURLs) > 0 {
p, srcName := a.resolveModalFallback("image")
if p == nil {
notices = append(notices, "当前模型不支持图片,且没有可用的视觉回退源"+
"(配置 core.input_processing.image.fallback_provider"+
"并在该源上设置 core.llm.sources.<name>.vision=true")
} else if text, err := a.chatModalFallbackBatch(p, "image", imgURLs, imgDetails); err != nil {
// 转写失败必须说出来。静默跳过会让模型以为「图里没内容」,
// 而事实是没人看过这些图。
notices = append(notices, fmt.Sprintf("图片转写失败(源 %s: %v", srcName, err))
log.Printf("[agent] modal fallback image(%d) via %s failed: %v", len(imgURLs), srcName, err)
} else {
label := "图片内容"
if len(imgURLs) > 1 {
label = fmt.Sprintf("%d 张图片/视频帧内容", len(imgURLs))
}
converted = append(converted, fmt.Sprintf("[%s · 由 %s 转写,非当前模型直接感知]\n%s", label, srcName, text))
res.Converted += len(imgURLs)
}
}
// 音频:同样一次请求
if len(audURLs) > 0 {
p, srcName := a.resolveModalFallback("audio")
if p == nil {
notices = append(notices, "当前模型不支持音频,且没有可用的音频回退源"+
"(配置 core.input_processing.audio.fallback_provider"+
"并在该源上设置 core.llm.sources.<name>.audio=true")
} else if text, err := a.chatModalFallbackBatch(p, "audio", audURLs, nil); err != nil {
notices = append(notices, fmt.Sprintf("音频转写失败(源 %s: %v", srcName, err))
log.Printf("[agent] modal fallback audio(%d) via %s failed: %v", len(audURLs), srcName, err)
} else {
converted = append(converted, fmt.Sprintf("[音频内容 · 由 %s 转写,非当前模型直接感知]\n%s", srcName, text))
res.Converted += len(audURLs)
}
}
if res.Skipped > 0 {
notices = append(notices, fmt.Sprintf(
"另有 %d 个媒体块未转写(单次上限 %d",
res.Skipped, modalFallbackMaxBlocks))
}
var parts []string
parts = append(parts, kept...)
parts = append(parts, converted...)
if len(notices) > 0 {
parts = append(parts, "[注意] "+strings.Join(notices, ""))
}
res.Text = strings.Join(parts, "\n\n")
res.Notice = strings.Join(notices, "")
return res
}
// prepareToolBlocks 判定当前主模型能否直接消费这批媒体块。
//
// 返回 (native, ""):能直接看/听,原样作为 Blocks 注入。
// 返回 (nil, text) :不能,已经回退链转写成文字,调用方并进纯文本 content。
// 返回 (nil, "") :既不能直接看也没回退源且无话可说(理论上不发生,
// transcribeBlocksForFallback 至少会给一条 notice
//
// 为何逐模态判定而不是一刀切:一批块里可能图能看、音频不能听(很多视觉
// 模型就是这样)。全部走回退会白白把本可直视的图降级成二手文字描述。
func (a *Agent) prepareToolBlocks(blocks []agentAPI.ContentBlock) ([]agentAPI.ContentBlock, string) {
canVision := agentAPI.ProviderSupportsVision(a.provider)
canAudio := agentAPI.ProviderSupportsAudio(a.provider)
var native []agentAPI.ContentBlock
var needFallback []agentAPI.ContentBlock
for _, b := range blocks {
switch b.Type {
case "image_url":
if canVision {
native = append(native, b)
} else {
needFallback = append(needFallback, b)
}
case "audio_url":
if canAudio {
native = append(native, b)
} else {
needFallback = append(needFallback, b)
}
default:
native = append(native, b) // text 等一律直通
}
}
if len(needFallback) == 0 {
return native, ""
}
res := a.transcribeBlocksForFallback(needFallback)
log.Printf("[agent] modal fallback: %d block(s) transcribed, %d skipped (provider=%s vision=%v audio=%v)",
res.Converted, res.Skipped, a.provider.Name(), canVision, canAudio)
// 部分能直视、部分需转写:把转写文字作为 text 块并入 native
// 这样两部分内容同时到达模型。
if len(native) > 0 {
if res.Text != "" {
native = append(native, agentAPI.ContentBlock{Type: "text", Text: res.Text})
}
return native, ""
}
return nil, res.Text
}
// chatModalFallbackBatch 向回退 provider 发**一次**请求,带上该模态的全部媒体。
//
// 多张图合包而非逐张调用:既为避开 N 倍往返延迟(生产实测逐帧调用使
// see_video 6 帧拖到 363 秒且 3/4 帧超时),也因为视觉模型看到成组帧时能
// 描述帧间变化,而逐帧转写只能得到 N 段互不相关的静态描述。
func (a *Agent) chatModalFallbackBatch(p agentAPI.Provider, kind string, urls, details []string) (string, error) {
if len(urls) == 0 {
return "", fmt.Errorf("no media to transcribe")
}
prompt := a.modalFallbackPrompt(kind)
if len(urls) > 1 && kind == "image" {
// 多张时补一句,否则模型容易只描述第一张。
prompt = fmt.Sprintf("%s\n\n共 %d 张(若为视频关键帧则按时间顺序),"+
"请逐张编号描述,并在最后概括帧间变化。", prompt, len(urls))
}
msg := agentAPI.Message{
Role: "user",
Blocks: []agentAPI.ContentBlock{{Type: "text", Text: prompt}},
}
for i, u := range urls {
if kind == "audio" {
msg.Blocks = append(msg.Blocks, agentAPI.ContentBlock{
Type: "audio_url",
AudioURL: &agentAPI.AudioURL{URL: u},
})
continue
}
detail := ""
if i < len(details) {
detail = details[i]
}
if detail == "" {
// 单张时看清细节;多张(视频帧)用 low 控住体积与耗时。
if len(urls) > 1 {
detail = "low"
} else {
detail = "high"
}
}
msg.Blocks = append(msg.Blocks, agentAPI.ContentBlock{
Type: "image_url",
ImageURL: &agentAPI.ImageURL{URL: u, Detail: detail},
})
}
ctx, cancel := context.WithTimeout(a.ctx, modalFallbackTimeout)
defer cancel()
resp, err := p.Chat(ctx, &agentAPI.CompletionRequest{
Model: a.modalFallbackModel(kind),
Messages: []agentAPI.Message{msg},
MaxTokens: modalFallbackMaxTokens,
})
if err != nil {
return "", err
}
out := strings.TrimSpace(resp.Content)
if out == "" {
// 空回复不能当成功。上游剥掉媒体块后模型往往回一句「我没看到图片」
// 或干脆空串——两种都说明这条回退链也没真看到。
return "", fmt.Errorf("回退源返回空内容(该源可能同样不支持此模态)")
}
return out, nil
}

View File

@ -0,0 +1,428 @@
package core
import (
"context"
"strings"
"testing"
agentAPI "gitcode.com/JianFeeeee/HomeAgent/internal/agent/api"
"gitcode.com/JianFeeeee/HomeAgent/pkg/types"
)
// stubProvider 是一个可声明多模态能力的假 provider。
// 记录收到的请求,供断言「回退链是否真的调了它」。
type stubProvider struct {
name string
vision bool
audio bool
reply string
err error
calls int
lastReq *agentAPI.CompletionRequest
}
func (s *stubProvider) Name() string { return s.name }
func (s *stubProvider) Chat(ctx context.Context, req *agentAPI.CompletionRequest) (*agentAPI.CompletionResponse, error) {
s.calls++
s.lastReq = req
if s.err != nil {
return nil, s.err
}
return &agentAPI.CompletionResponse{Content: s.reply}, nil
}
func (s *stubProvider) ChatStream(ctx context.Context, req *agentAPI.CompletionRequest) (<-chan agentAPI.StreamChunk, error) {
ch := make(chan agentAPI.StreamChunk)
close(ch)
return ch, nil
}
func (s *stubProvider) MaxContextTokens() int { return 8192 }
func (s *stubProvider) SupportsVision() bool { return s.vision }
func (s *stubProvider) SupportsAudio() bool { return s.audio }
// plainProvider 不实现 ModalProvider用于验证「未声明即按不支持处理」。
type plainProvider struct{ name string }
func (p *plainProvider) Name() string { return p.name }
func (p *plainProvider) Chat(ctx context.Context, req *agentAPI.CompletionRequest) (*agentAPI.CompletionResponse, error) {
return &agentAPI.CompletionResponse{Content: "ok"}, nil
}
func (p *plainProvider) ChatStream(ctx context.Context, req *agentAPI.CompletionRequest) (<-chan agentAPI.StreamChunk, error) {
ch := make(chan agentAPI.StreamChunk)
close(ch)
return ch, nil
}
func (p *plainProvider) MaxContextTokens() int { return 8192 }
const testPNG = "data:image/png;base64,iVBORw0KGgoAAAANSUhEUg=="
const testWAV = "data:audio/wav;base64,UklGRiQAAABXQVZF"
func imageBlock() agentAPI.ContentBlock {
return agentAPI.ContentBlock{
Type: "image_url",
ImageURL: &agentAPI.ImageURL{URL: testPNG, Detail: "auto"},
}
}
func audioBlock() agentAPI.ContentBlock {
return agentAPI.ContentBlock{
Type: "audio_url",
AudioURL: &agentAPI.AudioURL{URL: testWAV},
}
}
// newFallbackAgent 组装一个只带 provider/manager/inputCfg 的最小 Agent。
// 不走 New():那会拉起 embedder、记忆、后台循环与本测试无关。
func newFallbackAgent(main agentAPI.Provider, mgr *agentAPI.ProviderManager, cfg types.InputProcessingConfig) *Agent {
ctx, cancel := context.WithCancel(context.Background())
return &Agent{
provider: main,
providerManager: mgr,
inputCfg: cfg,
ctx: ctx,
cancel: cancel,
}
}
func TestPrepareToolBlocks_VisionCapableProviderPassesThrough(t *testing.T) {
main := &stubProvider{name: "vision-main", vision: true}
mgr := agentAPI.NewProviderManager()
mgr.Register("vision-main", main)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{})
native, fallbackText := a.prepareToolBlocks([]agentAPI.ContentBlock{imageBlock()})
if len(native) != 1 || native[0].Type != "image_url" {
t.Fatalf("能看图的主模型应原样透传 image_url得到 %+v", native)
}
if fallbackText != "" {
t.Fatalf("不该触发回退,却返回了文字: %q", fallbackText)
}
if main.calls != 0 {
t.Fatalf("不该额外调用 provider实际调了 %d 次", main.calls)
}
}
func TestPrepareToolBlocks_TextOnlyProviderFallsBackToTranscription(t *testing.T) {
main := &stubProvider{name: "text-main"} // vision=false
vis := &stubProvider{name: "vis-src", vision: true, reply: "一只橘猫坐在窗台上"}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
mgr.Register("vis-src", vis)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{
Image: types.ImageProcessingConfig{
FallbackProvider: "vis-src",
DescribePrompt: "描述这张图",
},
})
native, fallbackText := a.prepareToolBlocks([]agentAPI.ContentBlock{imageBlock()})
if len(native) != 0 {
t.Fatalf("纯文本主模型不该收到原生块,得到 %+v", native)
}
if !strings.Contains(fallbackText, "一只橘猫坐在窗台上") {
t.Fatalf("回退文字应含转写内容,得到 %q", fallbackText)
}
// 关键:模型必须知道这是二手转写而非自己直接看到的
if !strings.Contains(fallbackText, "非当前模型直接感知") {
t.Fatalf("回退文字必须标注来源,得到 %q", fallbackText)
}
if vis.calls != 1 {
t.Fatalf("应调用视觉源 1 次,实际 %d", vis.calls)
}
if main.calls != 0 {
t.Fatalf("不该拿图去问纯文本主模型,实际调了 %d 次", main.calls)
}
}
func TestPrepareToolBlocks_NoFallbackSourceReportsHonestly(t *testing.T) {
main := &stubProvider{name: "text-main"}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{})
native, fallbackText := a.prepareToolBlocks([]agentAPI.ContentBlock{imageBlock()})
if len(native) != 0 {
t.Fatalf("不该透传,得到 %+v", native)
}
// 这是本次修复的核心:没有能力也没有回退源时必须明说,
// 而不是静默丢弃让模型以为自己看过图了。
if !strings.Contains(fallbackText, "不支持图片") {
t.Fatalf("必须如实说明看不到图,得到 %q", fallbackText)
}
if !strings.Contains(fallbackText, "fallback_provider") {
t.Fatalf("应给出可操作的配置提示,得到 %q", fallbackText)
}
}
func TestPrepareToolBlocks_ProviderWithoutModalInterfaceTreatedAsTextOnly(t *testing.T) {
main := &plainProvider{name: "legacy"} // 未实现 ModalProvider
mgr := agentAPI.NewProviderManager()
mgr.Register("legacy", main)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{})
native, fallbackText := a.prepareToolBlocks([]agentAPI.ContentBlock{imageBlock()})
if len(native) != 0 {
t.Fatalf("未声明能力的 provider 应按不支持处理,却透传了 %+v", native)
}
if fallbackText == "" {
t.Fatal("应给出说明而非静默")
}
}
func TestPrepareToolBlocks_MixedModalitySplitsCorrectly(t *testing.T) {
// 主模型能看图但听不到音频——很多视觉模型正是这样。
// 图应直视,只有音频走回退,不能一刀切全部降级。
main := &stubProvider{name: "vision-only", vision: true}
aud := &stubProvider{name: "aud-src", audio: true, reply: "背景有钢琴声"}
mgr := agentAPI.NewProviderManager()
mgr.Register("vision-only", main)
mgr.Register("aud-src", aud)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{
Audio: types.AudioProcessingConfig{FallbackProvider: "aud-src"},
})
native, fallbackText := a.prepareToolBlocks([]agentAPI.ContentBlock{imageBlock(), audioBlock()})
if fallbackText != "" {
t.Fatalf("有原生块时转写应并入 native不该走 content 分支,得到 %q", fallbackText)
}
var imgCount, textCount int
for _, b := range native {
switch b.Type {
case "image_url":
imgCount++
case "text":
textCount++
if !strings.Contains(b.Text, "背景有钢琴声") {
t.Fatalf("text 块应含音频转写,得到 %q", b.Text)
}
}
}
if imgCount != 1 {
t.Fatalf("图应原样保留 1 个,得到 %d", imgCount)
}
if textCount != 1 {
t.Fatalf("音频转写应产出 1 个 text 块,得到 %d", textCount)
}
if aud.calls != 1 {
t.Fatalf("应调音频源 1 次,实际 %d", aud.calls)
}
}
func TestTranscribeBlocks_EmptyReplyCountsAsFailure(t *testing.T) {
// 回退源返回空串,往往意味着它上游也剥掉了媒体块。
// 这种情况绝不能当成功——否则又是一次假成功。
main := &stubProvider{name: "text-main"}
vis := &stubProvider{name: "vis-src", vision: true, reply: " "}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
mgr.Register("vis-src", vis)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{
Image: types.ImageProcessingConfig{FallbackProvider: "vis-src"},
})
res := a.transcribeBlocksForFallback([]agentAPI.ContentBlock{imageBlock()})
if res.Converted != 0 {
t.Fatalf("空回复不应计入成功转写,得到 Converted=%d", res.Converted)
}
if !strings.Contains(res.Notice, "转写失败") {
t.Fatalf("应报告转写失败,得到 Notice=%q", res.Notice)
}
}
func TestTranscribeBlocks_CapsBlockCount(t *testing.T) {
// see_video 能一次注入 10 帧。上限存在的理由不再是“逐帧调用慢”(现已合包),
// 而是图越多单请求体积越大、上游越慢且易超限。
main := &stubProvider{name: "text-main"}
vis := &stubProvider{name: "vis-src", vision: true, reply: "逐帧描述…"}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
mgr.Register("vis-src", vis)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{
Image: types.ImageProcessingConfig{FallbackProvider: "vis-src"},
})
blocks := make([]agentAPI.ContentBlock, 10)
for i := range blocks {
blocks[i] = imageBlock()
}
res := a.transcribeBlocksForFallback(blocks)
if res.Converted != modalFallbackMaxBlocks {
t.Fatalf("应只转写 %d 个,实际 %d", modalFallbackMaxBlocks, res.Converted)
}
if res.Skipped != 10-modalFallbackMaxBlocks {
t.Fatalf("应跳过 %d 个,实际 %d", 10-modalFallbackMaxBlocks, res.Skipped)
}
// 批量合包:上限内的帧应合成**一次**调用,而不是每帧一次。
// 生产实测逐帧调用使 see_video 6 帧拖到 363s 且 3 帧超时。
if vis.calls != 1 {
t.Fatalf("多帧应合包为 1 次调用,实际 %d 次", vis.calls)
}
// 且那一次请求里应带满上限数量的 image 块(加一个 text 提示块)
if vis.lastReq == nil || len(vis.lastReq.Messages) != 1 {
t.Fatal("应只发一条 user 消息")
}
imgBlocks := 0
for _, b := range vis.lastReq.Messages[0].Blocks {
if b.Type == "image_url" {
imgBlocks++
}
}
if imgBlocks != modalFallbackMaxBlocks {
t.Fatalf("单次请求应带 %d 个 image 块,实际 %d", modalFallbackMaxBlocks, imgBlocks)
}
// 跳过的部分也必须告知,否则模型以为自己看全了整段视频
if !strings.Contains(res.Notice, "未转写") {
t.Fatalf("应告知有块未转写,得到 %q", res.Notice)
}
}
func TestTranscribeBlocks_MultiImageBatchedIntoOneCall(t *testing.T) {
// 上限以内的多张图典型see_video 4 帧)同样只能一次调用。
main := &stubProvider{name: "text-main"}
vis := &stubProvider{name: "vis-src", vision: true, reply: "1) 开场 2) 中段 3) 结尾"}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
mgr.Register("vis-src", vis)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{
Image: types.ImageProcessingConfig{FallbackProvider: "vis-src"},
})
res := a.transcribeBlocksForFallback([]agentAPI.ContentBlock{
imageBlock(), imageBlock(), imageBlock(),
})
if vis.calls != 1 {
t.Fatalf("3 张图应合为 1 次调用,实际 %d", vis.calls)
}
if res.Converted != 3 {
t.Fatalf("应计入 3 个已转写,实际 %d", res.Converted)
}
if res.Skipped != 0 {
t.Fatalf("不该有跳过,实际 %d", res.Skipped)
}
// 多张时提示词应补上张数,否则模型容易只描述第一张
prompt := vis.lastReq.Messages[0].Blocks[0].Text
if !strings.Contains(prompt, "3 张") {
t.Fatalf("多张提示词应声明张数,得到 %q", prompt)
}
// 帧序列:插件显式给了 detail 就尊重它see_video 本来就传 low
// 只在未指定时才由回退链按张数选默认。
for _, b := range vis.lastReq.Messages[0].Blocks {
if b.Type == "image_url" && b.ImageURL.Detail != "auto" {
t.Fatalf("应保留插件显式指定的 detail=auto得到 %q", b.ImageURL.Detail)
}
}
}
func TestTranscribeBlocks_MultiImageDefaultsToLowDetail(t *testing.T) {
// 未指定 detail 的多张图(帧序列)用 low 控住体积与耗时。
main := &stubProvider{name: "text-main"}
vis := &stubProvider{name: "vis-src", vision: true, reply: "三帧描述"}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
mgr.Register("vis-src", vis)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{
Image: types.ImageProcessingConfig{FallbackProvider: "vis-src"},
})
bare := agentAPI.ContentBlock{Type: "image_url", ImageURL: &agentAPI.ImageURL{URL: testPNG}}
a.transcribeBlocksForFallback([]agentAPI.ContentBlock{bare, bare, bare})
for _, b := range vis.lastReq.Messages[0].Blocks {
if b.Type == "image_url" && b.ImageURL.Detail != "low" {
t.Fatalf("多张未指定时应默认 low得到 %q", b.ImageURL.Detail)
}
}
}
func TestTranscribeBlocks_SingleImageUsesHighDetail(t *testing.T) {
// 单张图see_picture要看清细节不吝惜 token。
main := &stubProvider{name: "text-main"}
vis := &stubProvider{name: "vis-src", vision: true, reply: "一只橘猫"}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
mgr.Register("vis-src", vis)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{
Image: types.ImageProcessingConfig{FallbackProvider: "vis-src"},
})
// Detail 置空,让回退链自己定
a.transcribeBlocksForFallback([]agentAPI.ContentBlock{
{Type: "image_url", ImageURL: &agentAPI.ImageURL{URL: testPNG}},
})
for _, b := range vis.lastReq.Messages[0].Blocks {
if b.Type == "image_url" && b.ImageURL.Detail != "high" {
t.Fatalf("单张应用 high detail得到 %q", b.ImageURL.Detail)
}
}
}
func TestResolveModalFallback_RejectsProviderNotDeclaringCapability(t *testing.T) {
// 配置指向一个没声明 vision 的源:照用只会重演静默剥离。
// 应拒绝它,并继续找真正声明了能力的源。
main := &stubProvider{name: "text-main"}
wrong := &stubProvider{name: "wrong-src"} // vision=false
right := &stubProvider{name: "right-src", vision: true}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
mgr.Register("wrong-src", wrong)
mgr.Register("right-src", right)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{
Image: types.ImageProcessingConfig{FallbackProvider: "wrong-src"},
})
p, name := a.resolveModalFallback("image")
if name != "right-src" {
t.Fatalf("应跳过未声明能力的 wrong-src 而选中 right-src得到 %q", name)
}
if p == nil {
t.Fatal("应返回可用 provider")
}
}
func TestResolveModalFallback_ScansForCapableSourceWhenUnconfigured(t *testing.T) {
// 用户可能只在源上声明了 vision 却忘了填 fallback_provider。
// 静默失败比多找一个能用的源更糟。
main := &stubProvider{name: "text-main"}
vis := &stubProvider{name: "some-vision-src", vision: true}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
mgr.Register("some-vision-src", vis)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{})
_, name := a.resolveModalFallback("image")
if name != "some-vision-src" {
t.Fatalf("未配置时应扫出声明了能力的源,得到 %q", name)
}
}
func TestPrepareToolBlocks_TextBlocksAlwaysPassThrough(t *testing.T) {
main := &stubProvider{name: "text-main"}
mgr := agentAPI.NewProviderManager()
mgr.Register("text-main", main)
a := newFallbackAgent(main, mgr, types.InputProcessingConfig{})
native, fallbackText := a.prepareToolBlocks([]agentAPI.ContentBlock{
{Type: "text", Text: "纯文字说明"},
})
if len(native) != 1 || native[0].Text != "纯文字说明" {
t.Fatalf("text 块应无条件直通,得到 %+v / %q", native, fallbackText)
}
}

View File

@ -316,6 +316,9 @@ func (a *Agent) process(input string, stageCtx *sdk.StageContext) (response stri
// 多模态工具结果:插件通过 SDK.SetToolBlocks 注入 image_url/audio_url block
// process.go 拾起并追加到 tool message 的 content 数组OpenAI 多模态格式),
// 让下一轮 LLM 请求在 tool message 里看到图/音频。
//
// 主模型不支持该模态时不能直接塞:网关会把 image_url 静默剥离后仍返回 200
// 模型回答「我没有看到图片」而内核以为注入成功。改走回退链转写成文字。
toolMsg := agentAPI.Message{Role: "tool", ToolCallID: tc.ID, Content: result}
if rawBlocks := a.io.ConsumeToolBlocks(); len(rawBlocks) > 0 {
var blocks []agentAPI.ContentBlock
@ -333,7 +336,17 @@ func (a *Agent) process(input string, stageCtx *sdk.StageContext) (response stri
}
}
if len(blocks) > 0 {
toolMsg.Blocks = blocks
if native, fallbackText := a.prepareToolBlocks(blocks); len(native) > 0 {
toolMsg.Blocks = native
} else if fallbackText != "" {
// 回退链已把媒体转写成文字:并进 tool message 的纯文本 content
// 不再挂 Blocks挂了也会被上游剥掉
toolMsg.Content = result + "\n\n" + fallbackText
result = toolMsg.Content
if len(toolResults) > 0 {
toolResults[len(toolResults)-1].Output = result
}
}
}
}
msgs = append(msgs, toolMsg)

View File

@ -188,6 +188,8 @@ var sourceFieldDefs = []struct {
{"adapter_path", "string", "适配器路径"},
{"max_concurrent", "int", "并发上限"},
{"priority", "int", "AUTO 优先级(大者优先)"},
{"vision", "bool", "支持图片"},
{"audio", "bool", "支持音频"},
}
// registerSourceDefs 注册 core.llm.sources.<name>.* 的 ConfigDef
@ -861,6 +863,8 @@ func (r *ConfigRegistry) ToConfig() *types.Config {
MaxConcurrent: readInt(p+".max_concurrent", 8),
Priority: readInt(p+".priority", 0),
ThinkingEnabled: readBool(p+".thinking_enabled", false),
Vision: readBool(p+".vision", false),
Audio: readBool(p+".audio", false),
})
}

View File

@ -7,6 +7,7 @@ import (
"os"
"os/exec"
"path/filepath"
"strconv"
"strings"
"gitcode.com/JianFeeeee/HomeAgent/internal/plugin"
@ -61,7 +62,7 @@ func (p *Plugin) Start(s *sdk.PluginSDK) error {
},
"frames": map[string]interface{}{
"type": "integer",
"description": "提取关键帧数量(默认 4最大 10",
"description": "均匀抽取的关键帧数量(默认 4最大 10。按视频总时长均分,不是每几秒一帧。",
},
},
"required": []string{"path"},
@ -175,6 +176,21 @@ func (p *Plugin) handleSeeVideo(args map[string]interface{}) (interface{}, error
}
}
// 用 ffprobe 拿时长,才能把「抽 N 帧」翻译成 ffmpeg 的帧率。
//
// 为何不能直接写 fps=1/Nfps 是**频率**(每 N 秒一帧),不是**数量**。
// 20 秒视频实测fps=1/4 → 5 帧fps=1/10 → 2 帧fps=1/1 → 20 帧——
// 要得越多拿得越少,且长视频下 frames=4 会产出时长/4 帧直接炸上下文。
// 正确写法是 fps=N/时长 配 -frames:v N实测 N=1/4/10 均精确)。
dur := probeDuration(ffmpegPath, path)
var vfArgs []string
if dur > 0 {
vfArgs = []string{"-vf", fmt.Sprintf("fps=%d/%.3f", nFrames, dur)}
}
// 拿不到时长(无 ffprobe / 容器无时长元数据):不传 -vf只靠 -frames:v
// 取开头 N 帧。不能退化成 fps=1不足 1 秒的素材一帧也抽不出来(实测
// 0.4s 视频 fps=1 → 0 帧),而 fps=N/dur 在 0.4s 上依然精确。
// 用 ffmpeg 提取关键帧
tmpDir, err := os.MkdirTemp("", "mm_video_*")
if err != nil {
@ -183,36 +199,46 @@ func (p *Plugin) handleSeeVideo(args map[string]interface{}) (interface{}, error
defer os.RemoveAll(tmpDir)
outPattern := filepath.Join(tmpDir, "frame_%03d.jpg")
cmd := exec.Command(ffmpegPath, "-i", path, "-vf", fmt.Sprintf("fps=1/%d", nFrames),
"-q:v", "5", outPattern)
// -frames:v 硬封顶:即使 fps 计算因时长误差多给了帧,也不会超出请求数量。
ffArgs := []string{"-v", "error", "-i", path}
ffArgs = append(ffArgs, vfArgs...)
ffArgs = append(ffArgs, "-q:v", "5", "-frames:v", strconv.Itoa(nFrames), outPattern)
cmd := exec.Command(ffmpegPath, ffArgs...)
if out, err := cmd.CombinedOutput(); err != nil {
return fmt.Sprintf("ffmpeg 提取帧失败: %v\n%s", err, string(out)), nil
}
// 读取提取的帧
// 读取提取的帧。按 blocks 长度而非目录索引封顶:
// 跳过的条目(非 jpg / 读失败 / 过大)会让索引与实际帧数错位。
entries, _ := os.ReadDir(tmpDir)
var blocks []pubsdk.ContentBlock
for i, entry := range entries {
if strings.HasSuffix(entry.Name(), ".jpg") {
b, err := os.ReadFile(filepath.Join(tmpDir, entry.Name()))
if err != nil {
continue
}
if len(b) > 2*1024*1024 {
continue // 跳过过大帧
}
dURL := "data:image/jpeg;base64," + base64.StdEncoding.EncodeToString(b)
blocks = append(blocks, pubsdk.ContentBlock{
Type: "image_url",
ImageURL: &pubsdk.ImageURL{URL: dURL, Detail: "low"},
})
if i >= 9 { // 最多 10 帧
break
}
var skippedLarge int
for _, entry := range entries {
if len(blocks) >= nFrames {
break
}
if !strings.HasSuffix(entry.Name(), ".jpg") {
continue
}
b, err := os.ReadFile(filepath.Join(tmpDir, entry.Name()))
if err != nil {
continue
}
if len(b) > 2*1024*1024 {
skippedLarge++
continue
}
dURL := "data:image/jpeg;base64," + base64.StdEncoding.EncodeToString(b)
blocks = append(blocks, pubsdk.ContentBlock{
Type: "image_url",
ImageURL: &pubsdk.ImageURL{URL: dURL, Detail: "low"},
})
}
if len(blocks) == 0 {
if skippedLarge > 0 {
return fmt.Sprintf("提取到 %d 帧但全部超过 2MB 单帧上限,未注入", skippedLarge), nil
}
return "视频中未提取到有效帧", nil
}
@ -220,9 +246,39 @@ func (p *Plugin) handleSeeVideo(args map[string]interface{}) (interface{}, error
p.sdk.SetToolBlocks(blocks)
text := fmt.Sprintf("[已将 %d 个视频关键帧注入后续对话] %s", len(blocks), path)
if skippedLarge > 0 {
text += fmt.Sprintf("(另有 %d 帧超 2MB 已跳过)", skippedLarge)
}
if len(blocks) < nFrames {
text += fmt.Sprintf("(请求 %d 帧,实际只取到 %d 帧,视频可能过短)", nFrames, len(blocks))
}
return text, nil
}
// probeDuration 用 ffprobe 取视频时长(秒),拿不到返回 0。
//
// ffprobe 与 ffmpeg 同包同目录,所以从已找到的 ffmpeg 路径推导而非重新搜一遍。
func probeDuration(ffmpegPath, videoPath string) float64 {
probe := "ffprobe"
if strings.Contains(ffmpegPath, "/") {
probe = filepath.Join(filepath.Dir(ffmpegPath), "ffprobe")
if _, err := os.Stat(probe); err != nil {
probe = "ffprobe"
}
}
out, err := exec.Command(probe, "-v", "error",
"-show_entries", "format=duration",
"-of", "default=nw=1:nk=1", videoPath).Output()
if err != nil {
return 0
}
d, err := strconv.ParseFloat(strings.TrimSpace(string(out)), 64)
if err != nil {
return 0
}
return d
}
// ── listen ───────────────────────────────────────────────────────
func (p *Plugin) handleListen(args map[string]interface{}) (interface{}, error) {

View File

@ -139,6 +139,8 @@ func (l *llmImpl) ReloadFromConfig() error {
ContextWindow: src.ContextWindow,
MaxConcurrent: src.MaxConcurrent,
Priority: src.Priority,
Vision: src.Vision,
Audio: src.Audio,
}, l.lua, src.Name, src.Adapter)
l.mgr.Register(src.Name, provider)
if src.Adapter != "" {