总览与架构
河狸陪 · AI Agent 架构

合理使用主控模型与 Subagent,构建高质量、低成本、可审计的多模型系统

不要用一个“最强模型”包办所有任务。真正稳定的系统应由确定性控制平面、规划模型、调度模型、专业 Worker、独立 Reviewer 和人工 Gate 共同组成。

Sol 负责想清楚与最终裁决;Terra / Sonnet 负责把项目带完;Kimi 负责长上下文;Luna / DeepSeek / MiniMax 负责规模化执行;Opus / Fable 负责独立挑战与极难任务。
3 层
Policy Engine · Planner/Judge · Dispatcher
1 个
同一时刻允许写入的 Agent
2–4 个
一般任务推荐 Subagent 数量
70–80%
Token 建议落在低成本 Worker

第一性原理:三个“主控”

把规则、规划与调度拆开,避免一个模型同时承担全部控制责任。

1

Policy Engine

确定性规则控制器,不是大模型。

  • 风险、权限、预算、并发
  • 超时、重试、终止与审计
  • L0–L4 状态与人工审批
2

Planner / Judge

高能力模型负责理解目标、拆解任务和最终裁决。

  • Sol / Opus 5 / 少量 Fable 5
  • 生成 DAG、验收标准与证据要求
  • 解决冲突并综合最终结果
3

Dispatcher / Foreman

中档模型按计划推进项目,不必持续使用最强模型。

  • Terra / Sonnet 5 / Kimi K3
  • 分发任务、检查格式、发起重试
  • 只将异常和证据上报 Planner

推荐控制架构

控制与执行分离,所有结果进入证据层,最后由独立 Judge 与人工 Gate 验收。

Policy Engine风险、预算、权限、并发、状态机
用户目标业务目标、约束、成功标准
Planner / JudgeSol、Opus 5、Fable 5
DispatcherTerra、Sonnet 5、Kimi K3
专业 Subagents研究、代码、测试、视觉、分类
Evidence + Review + Human Gate证据、Diff、测试、独立审查与审批

路由公式

不要按“哪个模型排行榜最高”来路由,要按任务结构与风险来路由。

新颖度 ↑ → 提升 Planner 能力
风险 ↑ → 提升 Judge 能力
调用量 ↑ → 降低 Worker 单价
上下文 ↑ → 使用长上下文专家
工具复杂时优先平台原生模型;不可验证时使用不同厂商独立审查。

默认分层

层级首选职责
顶层规划/最终裁决GPT-5.6 Sol复杂拆解、冲突处理、最终综合
Claude Code 高端主控Claude Opus 5长程编码、重构、跨文件工程
日常主控Terra / Sonnet 5调度、开发、研究、运营编排
长上下文专家Kimi K3 / Qwen大型仓库、长文档与知识库
规模化 WorkerLuna / DeepSeek / MiniMax扫描、分类、提取、测试与日志
独立审查Opus / Sol / Fable异构红队、高风险验收

模型角色矩阵

按厂商、角色和成本筛选。点击模型卡可跳转到路由向导。

模型路由向导

根据任务类型、风险、上下文、平台和规模自动生成主控与 Subagent 组合。

推荐方案

Terra 日常主控组合

Planner / ControllerGPT-5.6 Terra
DispatcherGPT-5.6 Terra
Primary WorkerClaude Sonnet 5
Context / ResearchKimi K3
Testing / BatchDeepSeek V4 Flash
Independent ReviewerGPT-5.6 Sol

四种协作模式

选择合适的任务拓扑,比单纯增加 Agent 数量更重要。

适用场景

多个子问题相互独立,适合并行完成后统一综合。

主控定义问题
A 市场规模
B 竞品
C 用户需求
D 风险
主控统一综合

控制要点

  • 任务必须真正独立,避免重复研究。
  • 所有 Agent 使用统一返回 Schema。
  • 主控只读取摘要、证据与 Artifact 地址。
  • 一般控制在 4–6 个只读 Agent。

河狸陪研发首选模式

不同模型按专长依次处理,每一步有明确输入输出和验收门槛。

Sol
制定 Spec
Kimi K3
仓库上下文地图
Sonnet 5
实现
DeepSeek Flash
测试
Opus 5
只读 Review
CI + 人工 Gate

适合高风险决策

Agent A
独立方案
Agent B
独立方案
Judge
证据裁决

关键规则

Agent B 在生成方案前不能看到 Agent A 的结论,避免锚定。Judge 应优先选择不同厂商模型,并只根据证据与验收标准裁决。

数据库迁移佣金结算权限政策重大预算

成本优先的能力升级阶梯

Luna / DeepSeek Flash
低成本首试
Terra / Sonnet 5
中档升级
Sol / Opus 5
高难处理
Fable 5
极难救援
升级由测试失败、Schema 不合法、证据缺失、连续工具失败、风险升高等可观测信号触发,不依赖模型自报“信心”。

Agent 数量约束

并发只在真正独立或需要独立验证时有价值。

一般任务

2–4 个 Subagent,避免协调成本超过执行收益。

复杂研究

4–6 个只读 Agent,每个负责互斥问题域。

代码修改

多个只读 Agent 可以并行,但同时仅 1 个写入 Agent

河狸陪预设 Profiles

可直接用于 Codex、Claude Code、OpenCode 或自建 Agent 平台的配置蓝本。

成本估算器

估算单次任务与批量任务的模型费用,并比较不同模型的成本级别。

价格仅复现原始内容中的示例口径,实际使用前应重新核验厂商价格、缓存、峰谷时段、工具调用和重试费用。

建议 Token 配置

把高端模型集中在规划、阶段转换、冲突解决、最终验收与高风险审查。

3%–5%

Sol / Opus / Fable:顶层规划、最终裁决、极难任务。

15%–25%

Terra / Sonnet / Kimi / DeepSeek Pro:日常主控与复杂执行。

70%–80%

Luna / DeepSeek Flash / MiniMax / Qwen Flash:批量 Worker。

真实成本公式

单个成功任务成本 =(模型调用 + 重试 + 协调 + 人工修改 + 错误返工)÷ 最终验收通过率不要只比较 Token 标价。

Subagent 任务合同生成器

把模糊的“帮我检查一下”转化为有边界、有证据、有预算的任务合同。


            

权限、风险与治理

高能力不能替代权限边界。生产稳定性依赖确定性 Gate,而非模型“谨慎程度”。

可自动执行。Agent 保持只读,不接触敏感凭证,不产生外部承诺。
可自动执行并记录来源;对外发送前需人工检查。
只允许一个写入 Agent;必须通过测试和 CI;不可直接触达生产。
必须由不同模型独立 Review,并经过人工 Review。适用于数据库结构、佣金、权限、结算等关键变更。
必须人工明确批准。Agent 只能生成执行计划、回滚方案和验证清单,不得自行操作。

Agent 最小权限表

Agent 类型建议权限限制
Scout / ResearcherRead-only不修改文件,不接触生产
ReviewerRead-only不得修复自己正在审查的代码
TesterWorkspace execute可运行测试,不改变生产状态
BuilderWorkspace write同一时刻仅 1 个写入 Agent
DispatcherOrchestration only原则上不直接修改业务代码
Planner / JudgeRead-only负责计划与裁决,不负责落地写入
Deployment AgentPlan only生成发布、验证和回滚方案

上线前治理检查

勾选状态保存在当前浏览器。

禁止模式

同模执行 + 同模 Review

这更像重复确认,不是独立审查。应使用不同厂商模型。

长上下文当垃圾桶

主控只保留索引、摘要和关键证据;原始材料进入 Artifact Store。

同线程临时切主控

需要更换 Profile 时,创建交接包并启动新线程。

并发 Agent 越多越好

超过 6 个 Agent 前,必须证明任务可独立分解且协调收益为正。

模型自行扩大权限

任何写入、删除、Commit、Push、生产访问都必须来自明确规则授权。

无限低成本重试

失败两次后升级能力层级,不要让低档模型无限消耗预算。

已复制