OmniRoute:把 352 家 AI 提供商拧成一个免费入口
AI 编程工具用得越狠,越会撞上两堵墙:贵(订阅 + API 按量计费,多工具多账单)和碎(各家 AI 提供商都有免费层,但几十个 SDK、几十种限额规则,手动"薅羊毛"几乎不可能)。OmniRoute 的答案是把这件事工程化:一个本地网关接住 352 个 AI 提供商(其中 90+ 带免费层,官方按共享池去重算出每月约 15.1 亿免费 tokens),一个 OpenAI 兼容端点喂给 Claude Code、Cursor、Cline 等 35 个编程工具;配额耗尽、服务故障、成本飙升时自动 fallback,请求再过一道 12 引擎压缩管线(集成 RTK + Caveman,官方口径平均省 89.2% tokens)。MIT 开源,npm 装完即用、无需任何 key。参考 GitHub 仓库。
1、概述:OmniRoute 是什么
官方口号 "The Free AI Gateway"(免费 AI 网关)。它跑在你本地(localhost:20128),对上是你的 AI 工具,对下是 352 家提供商,中间做智能路由、故障切换与 token 压缩:
定位 本地 AI 网关:一个端点 → 352 提供商,自动 fallback
版本 v3.8.50(1312 个唯一 chat 模型 ID,v3.9.0 LTS 在路上)
免费层 90+ 提供商;455 条免费层条目,40 个循环池 key
按共享池去重后 ≈15.1B 免费 tokens/月(官网仪表盘可查)
路由 19 种策略 + auto 智能路由(15 因子实时评分)
压缩 12 引擎可组合管线,默认 RTK→Caveman 堆叠(15~95%)
兼容 OpenAI / Claude / Gemini / Responses API(/v1 端点)
工具侧 Claude Code / Codex / Cursor / Cline / Copilot /
Antigravity 等 35 个 CLI/agent 一套配置全接
形态 npm / Docker / 桌面 Electron / Termux / PWA,43 种语言
License MIT,本地优先,密钥 AES-256-GCM 加密核心要点:
1. 它是"反向"的 OpenRouter:自托管本地网关,密钥不出你的机器
2. 核心主张:把订阅、API key、便宜渠道、免费层排成一条瀑布自动降级
3. 压缩内建:请求透明过压缩管线,客户端零改动
4. 版本迭代极快(v3.8.49→v3.8.50 间新增 62 家提供商)
2、核心理念:把"薅免费层"变成工程
README 里最 refreshing 的部分是它对"15 亿免费 tokens"这个大数字的算法公开与诚实——不是营销上限,而是可复核的目录计算:
// 官方口径:这个数字怎么算出来的
编目 455 条免费层条目(catalog)
归并 归到 40 个"循环池 key"(同一池共享额度只算一次)
计算 只取 20 个公布了"正的月度 token 预算"的池求和
→ 稳态 ≈1.51B/月;含注册赠金的首月最高 ≈2.13B
构成 Mistral 1B、LLM7 150M、Nara 150M、Gemini 60M 等
另列 永久免费但无 token 上限的提供商单独展示,
"绝不混入标题数字充数"
风险标注 15 家提供商在目录中标记 avoid(条款风险),让你自己决定
// 诚实条款(官方原文精神):
// 数字每两周对照在线目录重审一次,"两个方向都会动"——
// 有提供商关掉免费层就下降,有新的就上涨
// "发布目录实际计算出的数字,绝不发布四舍五入的最佳情况"核心要点:
1. 池去重是关键:同一额度池后挂多家入口,只算一次
2. 无上限的永久免费项单独列示,不掺水标题数字
3. 双周重审 + 双向浮动声明——把免费层当"活的目录"管理
4. 连"哪家有条款风险"都写进目录(avoid 标记),透明度罕见
3、零配置上手:装完即用的 auto
最能体现"Free Gateway"诚意的设计:全新安装、零密钥、零注册,model 填 auto 就能直接对话——因为两个免鉴权提供商(OpenCode Free、Felo)已预接线进 auto 组合:
// ① 安装并启动
npm install -g omniroute
omniroute // 仪表盘 localhost:20128,API 在 /v1
// ② 零密钥立即验证(新装机即可响应)
curl http://localhost:20128/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"auto","messages":[{"role":"user","content":"Hello!"}]}'
// ③ 接入你的编程工具(三行配置)
Base URL: http://localhost:20128/v1
API Key: [Dashboard → Endpoints 复制]
Model: auto // 零配置智能路由;也可指定任意 provider/model
// ④ 想要更多免费量?
// Dashboard → Providers → 一键连接 Kiro AI(免费 Claude,约 50 credits/月)
// 或 OpenCode Free(免鉴权)核心要点:
1. npm 两命令起步:装完 curl 就能通,没有"先注册"环节
2. model="auto" 是魔法入口——按已连接提供商实时评分构建虚拟组合
3. auto 家族各有取向:auto/coding 重质量、auto/cheap 便宜优先、
auto/fast 低延迟、auto/offline 重配额余量、auto/smart 带 10% 探索
4. 指定特定免费后端可用前缀直呼,如 oc/…(OpenCode Free)、felo/…
4、Combos:19 种路由策略
旗舰概念 Combo(组合):一条模型链,OmniRoute 在链上自动路由——配额耗尽、提供商故障或成本飙升时,自动切换到下一个健康的目标模型:
// 19 种路由策略(每个 combo 步骤可混搭)
基础分流 priority(按序榨干) fill-first(灌满再换) weighted(加权)
round-robin(轮询) p2c(两选一负载均衡) least-used(最少负载)
random / strict-random
成本与配额 cost-optimized(按目录价最小化 $/请求) headroom(配额余量最大)
reset-window(窗口最早重置优先) reset-aware(按重置时间排序)
上下文感知 context-relay(长对话跨目标交接上下文)
context-optimized(按上下文尺寸选最合身)
cache-optimized(可复用前缀钉住同账号,最大化 prompt 缓存命中)
粘性与智能 lkgp(粘住最近成功路径——auto 的默认)
auto(15 因子实时评分:健康/配额/成本/延迟/任务匹配/质量…)
高级编排 fusion(扇出到模型小组 + 裁判合成一个答案)
pipeline(链式:上一步输出喂给下一步)
// auto 引擎对每个候选连接做 15 因子打分(文档 docs/routing/AUTO-COMBO.md)
// 典型用法:不建 combo,直接用 auto —— 由已连接提供商动态拼出虚拟组合核心要点:
1. combo = 自动降级链:从付费订阅一路铺到免费层
2. cache-optimized 很精:把可复用前缀钉在同一账号吃满 prompt 缓存
3. fusion = "多模型会诊 + 裁判",pipeline = 固定加工流水线
4. 默认 lkgp"从一而终"——好用的路径不乱换,稳定又省心
5、12 引擎压缩管线:RTK + Caveman 叠加
OmniRoute 把业界最好的省 token 思路收编进一条透明管线——官方致谢 RTK、Caveman、微软 LLMLingua-2 与 Troglodita 的思想来源,请求过网关时自动压缩,客户端零改动:
// 12 个可组合引擎(按管线顺序,每个可独立开关、按 combo 配置)
1 Session-Dedup 跨轮次内容寻址去重(重复内容直接丢)
2 CCR 大块内容归档为"取回标记",按需取回
3 Lite 空白/图片 URL 修剪(低延迟基线)
4 RTK 命令感知的工具结果过滤/去重/截断
5 Responses Tool Output shell/patch/搜索/构建输出的无损优先压缩
6 Headroom 配额余量感知的压缩强度
7 Relevance 相关性过滤
8 Caveman 语义压缩(思路同穴居人库)
9 Aggressive 激进模式
10 LLMLingua-2 微软的小模型 token 压缩
11 Ultra 超紧凑
12 OmniGlyph 字形级极限压缩
// 默认堆叠:RTK → Caveman,节省按乘法复合:
combined = 1 − (1 − RTK) × (1 − Caveman)
average = 1 − (1 − 0.80) × (1 − 0.46) = 89.2%
range = 78.4% ~ 94.6%
// 官方示意:10,000 token 的请求最坏可压到约 1,080 token 到达提供商
// 保真底线:代码块、URL、JSON、结构化数据由保护引擎【始终保全】;
// 有损/实验模式只作用于符合条件的内容,且每步有 fidelity gate核心要点:
1. 压缩是网关内置能力——不用自己装 RTK/Caveman,过路即压缩
2. 堆叠节省按概率公式复合:80% + 46% ≈ 89.2%,不是简单相加
3. 代码/URL/JSON 永远保全——该精的地方一步不少
4. 每引擎可独立开关、按 combo 差异化配置——精细可控
6、三层韧性 + 四层瀑布降级
"永远有路可走"靠的是两套机制:纵向的四层配额瀑布,横向的三层独立自愈:
// 四层瀑布(请求的降级顺序)
Tier 1 Subscription 先吃你的订阅额度(Claude Pro/Max、Kimi Code 等)
Tier 2 API Key 再用付费 API key
Tier 3 Cheap 再降成本优化渠道
Tier 4 Free 最后落到免费层
// 只要还有任一健康可用目标,路由就不中断
// 三层独立自愈(右层管右层的故障)
Layer 1 提供商熔断器 整提供商级:408/5xx 连续超标跳闸
(阈值 OAuth 10 次 / API 15 次 / 本地 2 次)
半开探测懒恢复;熔断期间 combo 自动改道
Layer 2 连接冷却 单 key/账号级:基数 5s(OAuth)/3s(API) 指数退避
×2,429 尊重 Retry-After,防惊群;一个 key 冷却
时兄弟 key 继续服务
Layer 3 模型锁定 单模型级:该模型 429/404 只锁它自己,
绝不连坐整个连接
// 终态(封禁/过期/额度耗尽)交还给运维者处理,而非冷却掩盖核心要点:
1. 瀑布从贵到免费:订阅榨干才动 API,最后兜底免费层
2. 熔断/冷却/锁定各管一层故障,粒度从粗到细
3. 429 尊重 Retry-After + 防惊群——对免费层"温柔薅"
4. 团队场景:key 池 + Quota-Share 公平配额分摊
7、平台能力与生态位
除路由与压缩外,它还自带一整套生产控件,并与主流工具生态打通:
// 协议与集成
API 兼容 OpenAI / Claude / Gemini / Responses API,全走 /v1
Agent 生态 35 个 CLI/agent 一套配置接入
(Claude Code/Codex/Cursor/Cline/Copilot/Antigravity…)
MCP server 内置,110 个工具
A2A agent-to-agent 协议支持
Modality v3.8.50 新增 vision + audio + video 桥接
云 agents / 持久记忆 / guardrails / evals 一应俱全
// 安全与隐私
本地优先,密钥 AES-256-GCM 加密存储
3 级代理 + TLS 指纹 stealth(应对网络封锁环境)
39,000+ 静态测试断言、5,100+ 测试文件
// 可观测
实时分析仪表盘:用量 / 配额余量 / 节省额 / p95 延迟
免费层页面(/dashboard/free-tiers):used/remaining 实时可见
// 生态位(官方对比文档)
自对照 9router / OpenRouter / CLIProxyAPI / LiteLLM 十三项能力
差异点:免费层目录内建、12 引擎压缩、MCP 110 工具、
TLS stealth、MIT 自托管核心要点:
1. 四种 API 方言通吃——任何 OpenAI 兼容工具无需改造接入
2. MCP 110 工具 + A2A:网关本身也是可编程的 agent 基础设施
3. 本地自托管是与 OpenRouter 的本质分野(密钥不出机)
4. 仪表盘把"省了多少"变成可见数字,配额状态一目了然
8、总结
OmniRoute 把"用最少的钱跑最多的 AI"做成了一套完整工程:352 提供商一个端点、免费层目录化管理、19 种路由策略、12 引擎压缩、三层韧性四层瀑布——每一层都是对"账单焦虑"的一次系统化回应。
关键要点:
- 定位:免费 AI 网关——本地自托管,352 提供商,MIT 开源
- 免费:455 条免费层目录、池去重后 ≈15.1B tokens/月,双周重审
- 上手:npm 装完即用,model=auto 零配置,免鉴权后端预接线
- 路由:19 种策略(priority 到 fusion/pipeline),auto 15 因子评分
- 压缩:12 引擎管线默认 RTK→Caveman,复合节省约 89.2%
- 韧性:熔断/冷却/锁定三层 + 订阅→API→便宜→免费四层瀑布
- 生态:35 个编程工具接入,MCP 110 工具,OpenAI/Claude/Gemini 兼容
对于"订阅+API 多头付费"或"想白嫖又怕折腾"的开发者而言,OmniRoute 提供的是一个把碎片化供给变成统一资源池的本地枢纽——它最可贵的不只是省钱的幅度,而是把每一分免费额度、每一次故障切换、每一个被压缩的 token 都变成了可计算、可观测、可审计的工程对象:免费层有去重数学,节省有复合公式,故障有分层自愈,数字有双周重审。先 npm 装起来用 auto 白嫖第一句回答,再把你的 Claude Code 指向 localhost:20128/v1,接上已有的订阅与 key——看着仪表盘上"本月已省"的数字滚动,你会理解它 README 里那句话的分量:Never stop coding(别停下写代码)——限流、账单、断供,都交给网关去挡。
