全部笔记

如何设计一个多模型路由器

围绕能力、质量、延迟、成本与优雅降级设计模型选择策略。

LLMRoutingEvaluation

从路由策略开始

多模型路由器应该表达产品优先级,而不是追求一个通用模型排行榜。结构化提取看重稳定性,代码任务看重上下文理解,实时交互则可能更看重延迟。

在引入学习型路由之前,先定义一套输入明确、可以观察的小型策略。

TYPESCRIPT
type RoutePolicy = {
  requiredCapabilities: string[];
  maxLatencyMs: number;
  costTier: "low" | "balanced" | "high";
  fallbackModel: string;
};

分离资格过滤与排序

首先过滤掉无法满足上下文长度、工具调用、数据边界或结构化输出等硬要求的模型;然后再根据预测质量、成本和近期延迟,对剩余模型排序。

这种分离让失败原因更容易解释,也能防止便宜但不具备必要能力的模型通过加权得分胜出。

把反馈纳入路由

只有路由决策可以被评估,系统才可能持续改进。应记录路由输入、所选模型、回退路径、延迟、成本估计与任务结果,同时避免保存不必要的用户内容。

  • 按任务类型维护小型黄金测试集。
  • 修改生产策略前先运行影子评估。
  • 跟踪回退频率与具体原因。
  • 让路由规则和评估结果一起版本化。

优先考虑优雅降级

路由属于基础设施,因此失败行为非常重要。可靠系统可以重试瞬时错误、切换到兼容模型、安全缩减上下文,或主动请求澄清,但绝不能静默地把任务发送给违反硬要求的模型。

第一个真正有用的路由器通常只是一张清晰的策略表。只有当真实流量和评估数据证明静态规则不够用时,再引入学习型路由。