合理使用主控模型与 Subagent,构建高质量、低成本、可审计的多模型系统
不要用一个“最强模型”包办所有任务。真正稳定的系统应由确定性控制平面、规划模型、调度模型、专业 Worker、独立 Reviewer 和人工 Gate 共同组成。
第一性原理:三个“主控”
把规则、规划与调度拆开,避免一个模型同时承担全部控制责任。
Policy Engine
确定性规则控制器,不是大模型。
- 风险、权限、预算、并发
- 超时、重试、终止与审计
- L0–L4 状态与人工审批
Planner / Judge
高能力模型负责理解目标、拆解任务和最终裁决。
- Sol / Opus 5 / 少量 Fable 5
- 生成 DAG、验收标准与证据要求
- 解决冲突并综合最终结果
Dispatcher / Foreman
中档模型按计划推进项目,不必持续使用最强模型。
- Terra / Sonnet 5 / Kimi K3
- 分发任务、检查格式、发起重试
- 只将异常和证据上报 Planner
推荐控制架构
控制与执行分离,所有结果进入证据层,最后由独立 Judge 与人工 Gate 验收。
路由公式
不要按“哪个模型排行榜最高”来路由,要按任务结构与风险来路由。
风险 ↑ → 提升 Judge 能力
调用量 ↑ → 降低 Worker 单价
上下文 ↑ → 使用长上下文专家 工具复杂时优先平台原生模型;不可验证时使用不同厂商独立审查。
默认分层
| 层级 | 首选 | 职责 |
|---|---|---|
| 顶层规划/最终裁决 | GPT-5.6 Sol | 复杂拆解、冲突处理、最终综合 |
| Claude Code 高端主控 | Claude Opus 5 | 长程编码、重构、跨文件工程 |
| 日常主控 | Terra / Sonnet 5 | 调度、开发、研究、运营编排 |
| 长上下文专家 | Kimi K3 / Qwen | 大型仓库、长文档与知识库 |
| 规模化 Worker | Luna / DeepSeek / MiniMax | 扫描、分类、提取、测试与日志 |
| 独立审查 | Opus / Sol / Fable | 异构红队、高风险验收 |
模型角色矩阵
按厂商、角色和成本筛选。点击模型卡可跳转到路由向导。
模型路由向导
根据任务类型、风险、上下文、平台和规模自动生成主控与 Subagent 组合。
四种协作模式
选择合适的任务拓扑,比单纯增加 Agent 数量更重要。
适用场景
多个子问题相互独立,适合并行完成后统一综合。
B 竞品
C 用户需求
D 风险
控制要点
- 任务必须真正独立,避免重复研究。
- 所有 Agent 使用统一返回 Schema。
- 主控只读取摘要、证据与 Artifact 地址。
- 一般控制在 4–6 个只读 Agent。
河狸陪研发首选模式
不同模型按专长依次处理,每一步有明确输入输出和验收门槛。
制定 Spec
仓库上下文地图
实现
测试
只读 Review
适合高风险决策
独立方案
独立方案
证据裁决
关键规则
Agent B 在生成方案前不能看到 Agent A 的结论,避免锚定。Judge 应优先选择不同厂商模型,并只根据证据与验收标准裁决。
成本优先的能力升级阶梯
低成本首试
中档升级
高难处理
极难救援
Agent 数量约束
并发只在真正独立或需要独立验证时有价值。
一般任务
2–4 个 Subagent,避免协调成本超过执行收益。
复杂研究
4–6 个只读 Agent,每个负责互斥问题域。
代码修改
多个只读 Agent 可以并行,但同时仅 1 个写入 Agent。
河狸陪预设 Profiles
可直接用于 Codex、Claude Code、OpenCode 或自建 Agent 平台的配置蓝本。
成本估算器
估算单次任务与批量任务的模型费用,并比较不同模型的成本级别。
建议 Token 配置
把高端模型集中在规划、阶段转换、冲突解决、最终验收与高风险审查。
3%–5%
Sol / Opus / Fable:顶层规划、最终裁决、极难任务。
15%–25%
Terra / Sonnet / Kimi / DeepSeek Pro:日常主控与复杂执行。
70%–80%
Luna / DeepSeek Flash / MiniMax / Qwen Flash:批量 Worker。
真实成本公式
Subagent 任务合同生成器
把模糊的“帮我检查一下”转化为有边界、有证据、有预算的任务合同。
权限、风险与治理
高能力不能替代权限边界。生产稳定性依赖确定性 Gate,而非模型“谨慎程度”。
Agent 最小权限表
| Agent 类型 | 建议权限 | 限制 |
|---|---|---|
| Scout / Researcher | Read-only | 不修改文件,不接触生产 |
| Reviewer | Read-only | 不得修复自己正在审查的代码 |
| Tester | Workspace execute | 可运行测试,不改变生产状态 |
| Builder | Workspace write | 同一时刻仅 1 个写入 Agent |
| Dispatcher | Orchestration only | 原则上不直接修改业务代码 |
| Planner / Judge | Read-only | 负责计划与裁决,不负责落地写入 |
| Deployment Agent | Plan only | 生成发布、验证和回滚方案 |
上线前治理检查
勾选状态保存在当前浏览器。
禁止模式
同模执行 + 同模 Review
这更像重复确认,不是独立审查。应使用不同厂商模型。
长上下文当垃圾桶
主控只保留索引、摘要和关键证据;原始材料进入 Artifact Store。
同线程临时切主控
需要更换 Profile 时,创建交接包并启动新线程。
并发 Agent 越多越好
超过 6 个 Agent 前,必须证明任务可独立分解且协调收益为正。
模型自行扩大权限
任何写入、删除、Commit、Push、生产访问都必须来自明确规则授权。
无限低成本重试
失败两次后升级能力层级,不要让低档模型无限消耗预算。