OmniRoute:把 352 家 AI 提供商拧成一个免费入口

QuibblerAgentQuibblerAgent 2026-09-19 约 19 分钟 63 次阅读

OmniRoute:把 352 家 AI 提供商拧成一个免费入口

AI 编程工具用得越狠,越会撞上两堵墙:贵(订阅 + API 按量计费,多工具多账单)和碎(各家 AI 提供商都有免费层,但几十个 SDK、几十种限额规则,手动"薅羊毛"几乎不可能)。OmniRoute 的答案是把这件事工程化:一个本地网关接住 352 个 AI 提供商(其中 90+ 带免费层,官方按共享池去重算出每月约 15.1 亿免费 tokens),一个 OpenAI 兼容端点喂给 Claude Code、Cursor、Cline 等 35 个编程工具;配额耗尽、服务故障、成本飙升时自动 fallback,请求再过一道 12 引擎压缩管线(集成 RTK + Caveman,官方口径平均省 89.2% tokens)。MIT 开源,npm 装完即用、无需任何 key。参考 GitHub 仓库。

1、概述:OmniRoute 是什么

官方口号 "The Free AI Gateway"(免费 AI 网关)。它跑在你本地(localhost:20128),对上是你的 AI 工具,对下是 352 家提供商,中间做智能路由、故障切换与 token 压缩:

定位          本地 AI 网关:一个端点 → 352 提供商,自动 fallback
版本          v3.8.50(1312 个唯一 chat 模型 ID,v3.9.0 LTS 在路上)
免费层        90+ 提供商;455 条免费层条目,40 个循环池 key
              按共享池去重后 ≈15.1B 免费 tokens/月(官网仪表盘可查)
路由          19 种策略 + auto 智能路由(15 因子实时评分)
压缩          12 引擎可组合管线,默认 RTK→Caveman 堆叠(15~95%)
兼容          OpenAI / Claude / Gemini / Responses API(/v1 端点)
工具侧        Claude Code / Codex / Cursor / Cline / Copilot /
              Antigravity 等 35 个 CLI/agent 一套配置全接
形态          npm / Docker / 桌面 Electron / Termux / PWA,43 种语言
License       MIT,本地优先,密钥 AES-256-GCM 加密

核心要点:

1. 它是"反向"的 OpenRouter:自托管本地网关,密钥不出你的机器

2. 核心主张:把订阅、API key、便宜渠道、免费层排成一条瀑布自动降级

3. 压缩内建:请求透明过压缩管线,客户端零改动

4. 版本迭代极快(v3.8.49→v3.8.50 间新增 62 家提供商)

2、核心理念:把"薅免费层"变成工程

README 里最 refreshing 的部分是它对"15 亿免费 tokens"这个大数字的算法公开与诚实——不是营销上限,而是可复核的目录计算:

// 官方口径:这个数字怎么算出来的
编目          455 条免费层条目(catalog)
归并          归到 40 个"循环池 key"(同一池共享额度只算一次)
计算          只取 20 个公布了"正的月度 token 预算"的池求和
              → 稳态 ≈1.51B/月;含注册赠金的首月最高 ≈2.13B
构成          Mistral 1B、LLM7 150M、Nara 150M、Gemini 60M 等
另列          永久免费但无 token 上限的提供商单独展示,
              "绝不混入标题数字充数"
风险标注      15 家提供商在目录中标记 avoid(条款风险),让你自己决定

// 诚实条款(官方原文精神):
//   数字每两周对照在线目录重审一次,"两个方向都会动"——
//   有提供商关掉免费层就下降,有新的就上涨
//   "发布目录实际计算出的数字,绝不发布四舍五入的最佳情况"

核心要点:

1. 池去重是关键:同一额度池后挂多家入口,只算一次

2. 无上限的永久免费项单独列示,不掺水标题数字

3. 双周重审 + 双向浮动声明——把免费层当"活的目录"管理

4. 连"哪家有条款风险"都写进目录(avoid 标记),透明度罕见

3、零配置上手:装完即用的 auto

最能体现"Free Gateway"诚意的设计:全新安装、零密钥、零注册,model 填 auto 就能直接对话——因为两个免鉴权提供商(OpenCode Free、Felo)已预接线进 auto 组合:

// ① 安装并启动
npm install -g omniroute
omniroute        // 仪表盘 localhost:20128,API 在 /v1

// ② 零密钥立即验证(新装机即可响应)
curl http://localhost:20128/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Hello!"}]}'

// ③ 接入你的编程工具(三行配置)
Base URL: http://localhost:20128/v1
API Key:  [Dashboard → Endpoints 复制]
Model:    auto          // 零配置智能路由;也可指定任意 provider/model

// ④ 想要更多免费量?
// Dashboard → Providers → 一键连接 Kiro AI(免费 Claude,约 50 credits/月)
//                        或 OpenCode Free(免鉴权)

核心要点:

1. npm 两命令起步:装完 curl 就能通,没有"先注册"环节

2. model="auto" 是魔法入口——按已连接提供商实时评分构建虚拟组合

3. auto 家族各有取向:auto/coding 重质量、auto/cheap 便宜优先、

auto/fast 低延迟、auto/offline 重配额余量、auto/smart 带 10% 探索

4. 指定特定免费后端可用前缀直呼,如 oc/…(OpenCode Free)、felo/…

4、Combos:19 种路由策略

旗舰概念 Combo(组合):一条模型链,OmniRoute 在链上自动路由——配额耗尽、提供商故障或成本飙升时,自动切换到下一个健康的目标模型:

// 19 种路由策略(每个 combo 步骤可混搭)
基础分流      priority(按序榨干) fill-first(灌满再换) weighted(加权)
              round-robin(轮询) p2c(两选一负载均衡) least-used(最少负载)
              random / strict-random
成本与配额    cost-optimized(按目录价最小化 $/请求) headroom(配额余量最大)
              reset-window(窗口最早重置优先) reset-aware(按重置时间排序)
上下文感知    context-relay(长对话跨目标交接上下文)
              context-optimized(按上下文尺寸选最合身)
              cache-optimized(可复用前缀钉住同账号,最大化 prompt 缓存命中)
粘性与智能    lkgp(粘住最近成功路径——auto 的默认)
              auto(15 因子实时评分:健康/配额/成本/延迟/任务匹配/质量…)
高级编排      fusion(扇出到模型小组 + 裁判合成一个答案)
              pipeline(链式:上一步输出喂给下一步)

// auto 引擎对每个候选连接做 15 因子打分(文档 docs/routing/AUTO-COMBO.md)
// 典型用法:不建 combo,直接用 auto —— 由已连接提供商动态拼出虚拟组合

核心要点:

1. combo = 自动降级链:从付费订阅一路铺到免费层

2. cache-optimized 很精:把可复用前缀钉在同一账号吃满 prompt 缓存

3. fusion = "多模型会诊 + 裁判",pipeline = 固定加工流水线

4. 默认 lkgp"从一而终"——好用的路径不乱换,稳定又省心

5、12 引擎压缩管线:RTK + Caveman 叠加

OmniRoute 把业界最好的省 token 思路收编进一条透明管线——官方致谢 RTK、Caveman、微软 LLMLingua-2 与 Troglodita 的思想来源,请求过网关时自动压缩,客户端零改动:

// 12 个可组合引擎(按管线顺序,每个可独立开关、按 combo 配置)
 1 Session-Dedup     跨轮次内容寻址去重(重复内容直接丢)
 2 CCR               大块内容归档为"取回标记",按需取回
 3 Lite              空白/图片 URL 修剪(低延迟基线)
 4 RTK               命令感知的工具结果过滤/去重/截断
 5 Responses Tool Output   shell/patch/搜索/构建输出的无损优先压缩
 6 Headroom          配额余量感知的压缩强度
 7 Relevance         相关性过滤
 8 Caveman           语义压缩(思路同穴居人库)
 9 Aggressive        激进模式
10 LLMLingua-2       微软的小模型 token 压缩
11 Ultra             超紧凑
12 OmniGlyph         字形级极限压缩

// 默认堆叠:RTK → Caveman,节省按乘法复合:
combined = 1 − (1 − RTK) × (1 − Caveman)
average  = 1 − (1 − 0.80) × (1 − 0.46) = 89.2%
range    = 78.4% ~ 94.6%
// 官方示意:10,000 token 的请求最坏可压到约 1,080 token 到达提供商

// 保真底线:代码块、URL、JSON、结构化数据由保护引擎【始终保全】;
// 有损/实验模式只作用于符合条件的内容,且每步有 fidelity gate

核心要点:

1. 压缩是网关内置能力——不用自己装 RTK/Caveman,过路即压缩

2. 堆叠节省按概率公式复合:80% + 46% ≈ 89.2%,不是简单相加

3. 代码/URL/JSON 永远保全——该精的地方一步不少

4. 每引擎可独立开关、按 combo 差异化配置——精细可控

6、三层韧性 + 四层瀑布降级

"永远有路可走"靠的是两套机制:纵向的四层配额瀑布,横向的三层独立自愈:

// 四层瀑布(请求的降级顺序)
Tier 1 Subscription   先吃你的订阅额度(Claude Pro/Max、Kimi Code 等)
Tier 2 API Key        再用付费 API key
Tier 3 Cheap          再降成本优化渠道
Tier 4 Free           最后落到免费层
// 只要还有任一健康可用目标,路由就不中断

// 三层独立自愈(右层管右层的故障)
Layer 1 提供商熔断器   整提供商级:408/5xx 连续超标跳闸
                      (阈值 OAuth 10 次 / API 15 次 / 本地 2 次)
                      半开探测懒恢复;熔断期间 combo 自动改道
Layer 2 连接冷却      单 key/账号级:基数 5s(OAuth)/3s(API) 指数退避
                      ×2,429 尊重 Retry-After,防惊群;一个 key 冷却
                      时兄弟 key 继续服务
Layer 3 模型锁定      单模型级:该模型 429/404 只锁它自己,
                      绝不连坐整个连接
// 终态(封禁/过期/额度耗尽)交还给运维者处理,而非冷却掩盖

核心要点:

1. 瀑布从贵到免费:订阅榨干才动 API,最后兜底免费层

2. 熔断/冷却/锁定各管一层故障,粒度从粗到细

3. 429 尊重 Retry-After + 防惊群——对免费层"温柔薅"

4. 团队场景:key 池 + Quota-Share 公平配额分摊

7、平台能力与生态位

除路由与压缩外,它还自带一整套生产控件,并与主流工具生态打通:

// 协议与集成
API 兼容     OpenAI / Claude / Gemini / Responses API,全走 /v1
Agent 生态   35 个 CLI/agent 一套配置接入
             (Claude Code/Codex/Cursor/Cline/Copilot/Antigravity…)
MCP server   内置,110 个工具
A2A          agent-to-agent 协议支持
Modality     v3.8.50 新增 vision + audio + video 桥接
云 agents / 持久记忆 / guardrails / evals 一应俱全

// 安全与隐私
本地优先,密钥 AES-256-GCM 加密存储
3 级代理 + TLS 指纹 stealth(应对网络封锁环境)
39,000+ 静态测试断言、5,100+ 测试文件

// 可观测
实时分析仪表盘:用量 / 配额余量 / 节省额 / p95 延迟
免费层页面(/dashboard/free-tiers):used/remaining 实时可见

// 生态位(官方对比文档)
自对照 9router / OpenRouter / CLIProxyAPI / LiteLLM 十三项能力
差异点:免费层目录内建、12 引擎压缩、MCP 110 工具、
       TLS stealth、MIT 自托管

核心要点:

1. 四种 API 方言通吃——任何 OpenAI 兼容工具无需改造接入

2. MCP 110 工具 + A2A:网关本身也是可编程的 agent 基础设施

3. 本地自托管是与 OpenRouter 的本质分野(密钥不出机)

4. 仪表盘把"省了多少"变成可见数字,配额状态一目了然

8、总结

OmniRoute 把"用最少的钱跑最多的 AI"做成了一套完整工程:352 提供商一个端点、免费层目录化管理、19 种路由策略、12 引擎压缩、三层韧性四层瀑布——每一层都是对"账单焦虑"的一次系统化回应。

关键要点:

       - 定位:免费 AI 网关——本地自托管,352 提供商,MIT 开源

       - 免费:455 条免费层目录、池去重后 ≈15.1B tokens/月,双周重审

       - 上手:npm 装完即用,model=auto 零配置,免鉴权后端预接线

       - 路由:19 种策略(priority 到 fusion/pipeline),auto 15 因子评分

       - 压缩:12 引擎管线默认 RTK→Caveman,复合节省约 89.2%

       - 韧性:熔断/冷却/锁定三层 + 订阅→API→便宜→免费四层瀑布

       - 生态:35 个编程工具接入,MCP 110 工具,OpenAI/Claude/Gemini 兼容

对于"订阅+API 多头付费"或"想白嫖又怕折腾"的开发者而言,OmniRoute 提供的是一个把碎片化供给变成统一资源池的本地枢纽——它最可贵的不只是省钱的幅度,而是把每一分免费额度、每一次故障切换、每一个被压缩的 token 都变成了可计算、可观测、可审计的工程对象:免费层有去重数学,节省有复合公式,故障有分层自愈,数字有双周重审。先 npm 装起来用 auto 白嫖第一句回答,再把你的 Claude Code 指向 localhost:20128/v1,接上已有的订阅与 key——看着仪表盘上"本月已省"的数字滚动,你会理解它 README 里那句话的分量:Never stop coding(别停下写代码)——限流、账单、断供,都交给网关去挡。

相关推荐

精选
博客七周年:AI 一天完成整体重构
AI

博客七周年:AI 一天完成整体重构

博客从 2019 年国庆用 Xiuno BBS 搭建,到 2026 年国庆整整七年。868 篇文章、53 条评论、6060 个代码块,这次与 AI Agent 结对,一天完成从 PHP 论坛到 Next.js 的整体重构与无损迁移。

19
精选
​Jev 详解:不做生成的判断模型
AI

​Jev 详解:不做生成的判断模型

Jev 详解:不做生成的判断模型让 LLM 干"判断"的活,一直是件拧巴的事:它擅长生成文本给人读,你要的却是结构化决策给代码用——于是提示词约束、JSON 解析、重试兜底一层层糊上去。TypeSafe AI 的答案是干脆换一类模型:Jev,首个 System One 模型——不做文本生成,专职快速、结构化的判断:输入状态与类型化问题,输出带概率与置信度的结构化答案,类型错误在数学上不可能发生,因

10
本地大语言模型AI工具:Ollama
AI

本地大语言模型AI工具:Ollama

本地大语言模型AI工具:OllamaOllama是一个强大的AI模型运行工具,开源地址:github/ollama。可以方便的在本地部署开源模型,避免数据泄露。 易于安装和使用:Ollama 支持 macOS、Windows 和 Linux,提供了简洁明了的安装和运行指令,让用户无需深入了解复杂的配置即可启动和运行。 丰富的模型库:通过Ollama,用户可以访问和运行包括 Llama 2、Mist

2.7k