diff --git a/internal/agent/core/prompt_parallel_test.go b/internal/agent/core/prompt_parallel_test.go new file mode 100644 index 0000000..8e1fabb --- /dev/null +++ b/internal/agent/core/prompt_parallel_test.go @@ -0,0 +1,128 @@ +package core + +import ( + "strings" + "testing" +) + +// 阶段 2.5:提示词改为「默认并行」。 +// +// ⚠️ 本阶段有一条**硬性顺序约束**:必须在并行执行(阶段 2)落地**之后**。 +// 反序(先改提示词说"并发"、内核仍串行)会让提示词**对模型说谎** —— +// 模型据"并发执行"推断安全性,写出真正依赖顺序的调用。宁可晚改,不可错改。 +// +// 判据的负向部分(串行阶段不得出现"默认并行"字样)已在阶段 2 完成后 +// 才补写,故此处只断言**正向**内容:四要点齐全,且与 batchRunnable 的 +// 真实判据**一致**——提示词若与实现不符,比不说更坏。 + +// ① 四要点齐全:默认并行 / 不可依赖顺序 / 同通道保序 / 写类工具不并发。 +func TestPromptDeclaresParallelContract(t *testing.T) { + a := newPreemptAgent(t, newPreemptProvider()) + p := a.buildSystemPrompt("", "hi") + + required := []struct { + key string + words []string + }{ + {"默认并行", []string{"并行"}}, + {"不可依赖顺序", []string{"顺序"}}, + {"同通道保序", []string{"保序"}}, + {"并发安全声明", []string{"并发安全", "ParallelSafe", "声明"}}, + } + for _, r := range required { + found := false + for _, w := range r.words { + if strings.Contains(p, w) { + found = true + break + } + } + if !found { + t.Errorf("提示词缺少要点「%s」(期望含 %v 之一)", r.key, r.words) + } + } +} + +// ② ★ 提示词必须与实现**一致**,不能只说一半。 +// +// batchRunnable 的真实规则是「全批都 ParallelSafe 才并发,且同通道 +// 多次发送不并发」。若提示词只说"会并行"而不说例外,模型会在 +// 「同通道连发」时误以为顺序无关 —— 而实现恰恰保证了保序(安全但 +// 模型不知情);反过来若说"永远串行"则与实现矛盾。 +// +// 本判据钉死:提示词里必须同时出现"例外/不并发"的限定语。 +func TestPromptStatesExceptionsNotJustParallelism(t *testing.T) { + a := newPreemptAgent(t, newPreemptProvider()) + p := a.buildSystemPrompt("", "hi") + for _, w := range []string{"例外", "不会并发", "不并发"} { + if strings.Contains(p, w) { + return + } + } + t.Error("提示词只讲并行、不讲例外 —— 与 batchRunnable 的实际规则不符,模型会误判") +} + +// ③ output_send__ 同通道保序这一条必须**显式**告诉模型。 +// +// 理由:保序是内核替模型兜住的行为,模型不知道就可能依赖"反正并发" +// 来发多条消息,从而写出让保序失去意义的东西(如把"重试"和"确认" +// 并发发出)。显式说明能让模型据此主动选择分轮。 +func TestPromptExplainsSameChannelOrdering(t *testing.T) { + a := newPreemptAgent(t, newPreemptProvider()) + p := a.buildSystemPrompt("", "hi") + if !strings.Contains(p, "output_send__") { + t.Fatal("提示词未提及 output_send__,无法说明同通道保序") + } + if !strings.Contains(p, "保序") { + t.Error("提示词未说明同通道多次发送会保序") + } +} + +// ④ spawn_child 的旧表述必须改掉。 +// +// 原文是「应并行 spawn 多个子 Agent,不要自己串行逐个执行」——它在并行化 +// 之前是**落空**的(模型照做,内核仍串行)。改造后应改为机制性表述。 +func TestPromptSpawnChildNoLongerOverpromises(t *testing.T) { + a := newPreemptAgent(t, newPreemptProvider()) + desc := toolDefDescription(a, "spawn_child") + if desc == "" { + t.Fatal("buildToolDefs 里没有 spawn_child") + } + // 若保留「并行 spawn」的建议,必须同时说明它现在真的并发 + // (否则又是一句落空的建议)。这里只要求不出现旧的绝对化措辞。 + if strings.Contains(desc, "不要自己串行逐个执行") { + t.Error("spawn_child 描述仍含旧的「不要自己串行逐个执行」——该建议在并行化前是落空的") + } +} + +// ⑤ 提示词改动不得破坏既有要点(回归防护)。 +func TestPromptKeepsExistingContract(t *testing.T) { + a := newPreemptAgent(t, newPreemptProvider()) + p := a.buildSystemPrompt("", "hi") + for _, want := range []string{ + "【输出规则】", + "output_list_channels", + "【可用工具能力】", + "【记忆清理指令】", + } { + if !strings.Contains(p, want) { + t.Errorf("提示词丢失既有要点 %q", want) + } + } +} + +// toolDefDescription 从 buildToolDefs 的产物里取某工具的 description。 +// 直接查真实产物,而不是另建一套注册表——判据必须对着**代码真实输出**。 +func toolDefDescription(a *Agent, name string) string { + for _, t := range a.buildToolDefs() { + fn, ok := t.(map[string]interface{})["function"].(map[string]interface{}) + if !ok { + continue + } + if n, _ := fn["name"].(string); n == name { + d, _ := fn["description"].(string) + return d + } + } + return "" +} diff --git a/internal/agent/core/tooldefs.go b/internal/agent/core/tooldefs.go index c560468..94bb083 100644 --- a/internal/agent/core/tooldefs.go +++ b/internal/agent/core/tooldefs.go @@ -163,6 +163,18 @@ func (a *Agent) buildSystemPrompt(memContext string, userInput string) string { prompt += "\n\n【中断消息】长任务执行期间,工具/插件/定时器等会通过中断机制向你发送提醒(如 QQ 新消息、终端输出到达、定时器到点等)。中断消息以 system 角色注入,内容带 [中断消息] 前缀,**不是用户发言,但也必须认真处理**:优先停下当前长任务,针对中断内容作出响应或决定继续执行。不要忽略带 [中断消息] 前缀的 system 消息。" + // 工具执行顺序(阶段 2.5)。必须在**并行执行落地之后**才加: + // 反序会让本段对模型说谎——说"并发"而内核仍串行,模型据此推断 + // 安全性并写出真正依赖顺序的调用。宁可晚改,不可错改。 + // + // ⚠️ 措辞必须与 batchRunnable 的**真实**判据一致(全批 ParallelSafe + // 才并发 + 同通道保序),否则只是把"没说"换成"说错"。 + prompt += "\n\n【工具执行顺序】同一条回复里给出多个工具调用时,内核**默认并行执行**(同时跑),不是依次执行。这带来三条你必须知道的规则:\n" + prompt += "- **不要依赖执行顺序**:若某个调用的参数需要另一个调用的结果,就**分两轮**——先发前一个,看到结果后再发下一个。写在同一轮里就等于假设了不存在的先后。\n" + prompt += "- **例外一:同一通道的输出发送会保序**。对**同一个**通道连续调用多次 `output_send__`,内核会**按你发出的顺序依次执行**(用户可见消息顺序敏感),不会并发打乱。所以「先发回执、再发结论」这类有序发送可以放在同一轮;但若后续内容依赖前一条的用户反应,仍应分轮。\n" + prompt += "- **例外二:不并发安全的工具不会并发**。写类工具(记忆/知识/文档写入等)与未声明并发安全的工具,**整批会退回依次执行**——同一批里只要有一个这样的工具,这一批就全部串行。这对你是透明的:你不需要判断,只需知道「同轮并发」不是无条件保证的。\n" + prompt += "- 工具是否并发安全由**工具自己声明**(`ParallelSafe`),不由你决定;你只需按上面第 1 条判断能否同轮发出。\n" + prompt += "\n\n【输出规则】消息不会自动发送到对话来源通道,你必须自己决定如何回复:\n" prompt += "- **不要假设当前通道是某个固定值**:同一会话里可能同时有多个来源(多设备、多通道、子任务)。\n" prompt += " 先看这条消息本身与上下文里的来源信息,再决定往哪里回;不确定有哪些通道时先调 output_list_channels。\n" @@ -463,7 +475,7 @@ func (a *Agent) buildToolDefs() []interface{} { "plugin_name": map[string]interface{}{"type": "string", "description": "插件名,如 qq / remotedevice / weather", "default": ""}, })) - tools = append(tools, toolDef("spawn_child", "启动一个异步子 Agent 执行独立任务。子 Agent 后台运行,不阻塞当前对话。完成后系统会自动通知你,届时请调用 child_result 工具查看输出。\n使用时机:多个互不依赖的子任务(如同时查三个网站、分别处理多个文件)应并行 spawn 多个子 Agent,不要自己串行逐个执行;长耗时任务(批量处理、多轮搜索)也应交给子 Agent,避免阻塞对话。", map[string]interface{}{ + tools = append(tools, toolDef("spawn_child", "启动一个异步子 Agent 执行独立任务。子 Agent 后台运行,不阻塞当前对话。完成后系统会自动通知你,届时请调用 child_result 工具查看输出。\n使用时机:多个互不依赖的子任务(如同时查三个网站、分别处理多个文件)可以在**同一轮**里一次 spawn 多个子 Agent——同轮调用默认并行,子 Agent 会各自后台启动(是否真正并发取决于工具的并发安全声明)。长耗时任务(批量处理、多轮搜索)也应交给子 Agent,避免阻塞对话。注意:一次 spawn 只是一个启动动作;要立刻拿到结果仍需另一次 `child_result` 调用。", map[string]interface{}{ "task": map[string]interface{}{ "type": "string", "description": "要子 Agent 完成的任务描述。请描述清晰、完整,包含所有必要背景。",