vLLM Semantic Router
Mixture of Models (MoM) 的系统级智能 - 一个为 LLM 系统带来集体智能(Collective Intelligence)的智能路由层。作为 Envoy ExtProc(External Processor)运行,它利用 Signal-Driven Decision Engine(信号驱动决策引擎) 和 Plugin Chain 架构(插件链架构) 来捕获缺失的信号,做出更好的路由决策,并保护您的 LLM 基础设施。
项目目标
我们致力于构建 Mixture of Models (MoM) 的系统级智能,将 Collective Intelligence(集体智能) 引入 LLM 系统,以回答以下问题:
- 如何捕获请求、响应和上下文中的缺失信号?
- 如何结合这些信号以做出更好的决策?
- 如何在不同模型之间更高效地协作?
- 如何保护现实世界和 LLM 系统免受 jailbreak(越狱)、PII 泄漏和 hallucination(幻觉)的侵害?
- 如何收集有价值的信号并构建自学习系统?
核心架构
Signal-Driven Decision Engine
捕获并结合 9 种请求信号以做出智能路由决策:
| 信号类型 | 描述 | 用例 |
|---|---|---|
| keyword | 支持 AND/OR 运算符的模式匹配 | 针对特定术语的快速规则路由 |
| embedding | 基于 embedding 的语义相似度 | 意图检测和语义理解 |
| domain | MMLU 领域分类(14 个类别) | 学术和专业领域路由 |
| fact_check | 基于 ML 的事实核查需求检测 | 识别需要事实验证的查询 |
| user_feedback | 用户满意度和反馈分类 | 处理后续消息和更正 |
| preference | 基于 LLM 的路由偏好匹配 | 通过外部 LLM 进行复杂意图分析 |
| language | 多语言检测(100 多种本地化语言) | 路由查询特定语言的模型 |
| context | 基于 token 数量的上下文分类 | 将短/长上下文请求路由到更合适的模型 |
| complexity | 查询难度分类(easy/medium/hard) | 将任务难度匹配到模型能力 |