WeKnora:腾讯开源的企业级知识库引擎
企业里最痛的知识管理现状是:文档躺在飞书、Notion、语雀、本地 PDF 里"沉睡"——查不到、问不了、更不会自我生长。腾讯(微信团队)开源的 WeKnora 给出的答案是把它变成"活知识"(Living Knowledge):官方口号 "Turn Documents into Living Knowledge with RAG, Agents and Auto-Wiki"。它是一个 LLM 驱动的企业级知识框架——RAG 快速问答处理日常查询、ReAct Agent 自主编排检索与工具处理多步任务、独创的 Wiki 模式让 agent 把原始文档蒸馏成自维护、互链的 markdown 知识库。配合多源同步、10 个 IM 渠道、企业级 RBAC 与全模块可插拔架构,是目前开源领域功能最完整的企业知识引擎之一。参考 GitHub 仓库。
1、概述:WeKnora 是什么
WeKnora 是开源(MIT)、LLM 驱动的企业级知识框架,聚焦文档理解、语义检索与自主推理。当前版本 v0.7.2,迭代非常活跃(从 v0.2 到 v0.7 几乎每月大版本):
定位 企业级知识框架:文档理解 + 语义检索 + 自主推理
出品 腾讯(微信团队,官网 weknora.weixin.qq.com)
三大能力 RAG 快速问答 / ReAct Agent / Auto-Wiki 自动知识库
知识管理 文件夹树 + chunk 编辑修订 + 多源自动同步
模型生态 20+ LLM / 8 向量库 / 7 对象存储,全部可插拔
触达渠道 10 个 IM(企微/飞书/钉钉/Telegram/微信...)+ 网页 embed
+ Chrome 扩展 + 微信小程序
企业能力 多工作区 RBAC / AES-256 加密 / Langfuse 可观测 / Helm 部署
License MIT,v0.7.2核心要点:
1. 三大能力分工明确:查(RAG)、推理(Agent)、整理(Wiki)
2. 全模块化:LLM、向量库、存储后端都能换,支持本地/私有云部署保数据主权
3. 触达面极广:知识不只躺在网页里,还能进 IM、进浏览器、进小程序
4. 企业级完整度:RBAC、审计日志、加密、可观测一应俱全,不像玩具项目
2、三大核心能力
WeKnora 的功能全部围绕三种使用形态展开,从简单到复杂层层递进:
① RAG 快速问答(Quick Q&A)
场景:日常查询"报销流程是什么"
链路:检索知识库 → 命中片段 → LLM 组装带引用的回答
特点:快而准;行内引用浮窗 + 参考文献抽屉(区分网页/知识库来源)
② ReAct Agent(自主推理)
场景:复杂多步任务"对比这三个方案的成本并给出建议"
链路:ReAct 渐进式多步推理,自主编排:
知识检索 + MCP 工具(含 OAuth2 远程服务)+ 网页搜索
特点:并行工具调用;@Skill / @MCP 提及可按轮次限定 agent 运行时
③ Wiki 模式(Auto-Wiki)★ 独创
场景:让散乱文档"自我整理"成体系化知识库
链路:agent 蒸馏原始文档 → 生成结构化、互链的 markdown wiki 页
特点:交互式知识图谱;浏览器内手动编辑;
页面修订历史 + 行级 diff + 一键回滚核心要点:
1. RAG 管"查得快":引用可溯源,RAG 流水线分阶段进度可视
2. Agent 管"想得深":ReAct 循环 + 工具编排,处理开放任务
3. Wiki 管"长得成体系":这是 WeKnora 区别于普通 RAG 平台的招牌
4. 会话层还有建议问题、追问推荐、临时附件(会话级图片/文档异步解析)
3、Auto-Wiki:把文档蒸馏成活知识
Wiki 模式是最值得展开的亮点——它把"知识库"从"一堆检索切片"升级为"一份自维护、可阅读、可编辑的知识资产":
// Auto-Wiki 工作方式
输入:散乱的原始文档(PDF/Word/飞书导出/网页...)
过程:agent 阅读、蒸馏、组织
输出:结构化 + 互链的 markdown wiki 页面集合
+ 交互式知识图谱(页面关系可视化)
// "自维护"的工程保障(v0.5.2 起 Wiki 摄入扩展到 4 万文档级知识库)
任务队列 + 死信队列(DLQ)处理大规模 wiki 生成
独立的 Wiki worker 池,不挤占主流程
// "人机共治"的知识治理
浏览器内手动编辑:agent 生成的不满意?直接改
修订历史:每次修改留快照
行级 diff:精确看到改了什么
一键回滚:改坏了退回任意历史版本
// 与 chunk 编辑(第4节)呼应:
// 检索层能编辑 chunk,知识层能编辑 wiki 页——两层都可人工策展核心要点:
1. Wiki 不是"检索结果的堆放",而是有结构、有链接的知识体系
2. 知识图谱可视化页面关系,浏览与检索双入口
3. 修订历史 + 行级 diff + 回滚——像管代码一样管知识
4. 4 万文档级扩展能力 + 独立 worker 池,敢用于真实企业规模
4、知识管理:像管文档一样管检索块
WeKnora 的知识策展(curation)做得极其"动手"——两个特色能力让知识库质量可被人工持续打磨:
① 文件夹树(v0.7.2 新增)
上传文件夹 → 保留原始目录结构(路径是一等数据)
侧边栏树形浏览,像文件管理器一样:
重命名文件夹 / 把文档重新归档到其他文件夹
② Chunk 编辑与修订历史(v0.7.2 新增)
检索切片(chunk)直接在 UI 里编辑!
每版本快照 + diff + 一键回滚
编辑后自动重建索引(reindex)
生成的问题(用于检索)可增删改、可重新生成
支持自定义文档元数据
// 为什么重要?
// 传统 RAG:切坏了只能重新解析整个文档,"黑盒碰运气"
// WeKnora:切坏了直接改那一个块 → 检索质量可持续人工优化
③ 灵活的解析配置
每次上传可覆盖:解析器 / 分块策略 / 多模态(VLM/ASR) /
图谱抽取 / 问题生成(上传确认对话框或 process_config API)
批量重解析:多个文档换配置重跑
自适应三级分块 + 实时预览核心要点:
1. chunk 可编辑是杀手级能力——检索质量的"最后一公里"人工可控
2. 文件夹树保留上传结构,知识库组织符合直觉
3. 每次上传可定制解析管线,同一库内不同文档可用不同策略
4. 检索策略丰富:BM25 / 稠密 / GraphRAG / 父子分块 / HNSW pgvector
5、多源摄入与触达生态
知识"进得来"也"出得去"——WeKnora 的摄入源与触达渠道矩阵覆盖了国内外主流平台:
// 摄入(进):多源自动同步
飞书 wiki / 飞书云盘 / Lark 国际版 / Notion / 语雀 / RSS
支持增量与全量同步;飞书大 wiki 同步有韧性处理
格式:PDF/Word/TXT/MD/HTML/EPUB/MHTML/图片/CSV/Excel/PPT/JSON(10+)
Chrome 扩展:浏览器里选中文字/图片/整页,一键存入知识库
// 触达(出):知识长在用户待的地方
IM 十渠道:企微 / 飞书 / Lark / QQBot / Slack / Telegram /
钉钉 / Mattermost / 微信 / 云之家
网页 embed 组件:把 agent 发布到外部网站
(域名白名单 + 限流 + 安全世界 token 交换)
微信小程序:移动端配置与问答
CLI:weknora 命令行(agent-first JSON 输出,适合 AI agent 驱动)
// 编程接入
Scoped API keys(能力级授权 + 限定知识库 + 限流)
MCP Server:PyPI 官方包 tencent-weknora-mcp,
29 个工具,stdio/SSE/HTTP 三种传输
DeepSeek Harness 插件:给 dsh 编码 agent 装上 4 个只读知识工具
ClawHub Skill:文档导入/混合检索/条目管理核心要点:
1. 摄入端自动同步五大数据源,知识随源更新而更新
2. 触达端 10 个 IM + embed + 小程序——"知识找人"而非"人找知识"
3. MCP 29 工具让它成为 AI 生态里的可编程知识服务
4. CLI 的 agent-first 设计(JSON 包络 + 类型化错误码)专为 AI 驱动优化
6、企业级平台能力
真正拉开与个人项目差距的是平台层——权限、安全、可观测、任务治理四件套:
// 权限:多工作区 RBAC
4 级角色矩阵:Owner / Admin / Contributor / Viewer
per-KB 资源所有权(知识库级别的归属控制)
工作区审计日志 / 仅邀请制工作区 / 跨工作区超级管理员
// 安全
AES-256-GCM 静态加密:API key 与 MCP/数据源凭证(支持密钥轮换)
应用与文档解析服务之间 gRPC TLS + Token
SSRF 安全 HTTP 客户端(数据源/URL 导入/重定向链)
响应中的密钥自动脱敏;Agent Skills 沙箱隔离执行
// 可观测
Langfuse 集成(唯一 tracing 后端):
ReAct 循环 / token 追踪 / 工具调用 / 全流水线 tracing
Langfuse 风格的文档解析 trace 时间线(分阶段进度,可停止解析)
系统级运行时任务队列仪表盘:
队列深度 / 每模型并发 / 失败任务检查与手动重试
// 任务治理
MQ 异步任务 + 分阶段 worker 池
(core / 后处理 / 增强 / 维护 + 弹性共享池 + 独立 Wiki 池)
每模型后台并发调节器;版本升级自动数据库迁移核心要点:
1. RBAC 细到知识库级,审计日志可追溯,满足企业合规
2. 凭证全程加密存储,SSRF/脱敏/沙箱等安全细节扎实
3. Langfuse 全链路可观测,agent 的每一步推理都看得见
4. 任务队列仪表盘 + worker 池治理,大规模文档处理不失控
7、模型生态与快速部署
一切组件皆可插拔替换,Docker 五条命令起步:
// 可插拔矩阵
LLM(20+):OpenAI / Azure / Anthropic / DeepSeek / Qwen / 智谱 /
混元 / 豆包 / Gemini / MiniMax / NVIDIA / Ollama / ...
Embedding:Ollama / BGE / GTE / 智谱 / OpenAI 兼容 API
向量库(8):pgvector / Elasticsearch / OpenSearch / Milvus /
Weaviate / Qdrant / Apache Doris / 腾讯 VectorDB
对象存储(7):本地 / MinIO / AWS S3 / 腾讯 TOS / 阿里 OSS /
金山 KS3 / 华为 OBS(每工作区可多实例 + 按库绑定)
Web 搜索(9):DuckDuckGo / Bing / Google / Tavily / 百度 / SearXNG...
部署:本地 / Docker / Kubernetes (Helm),支持私有云与离线# 五条命令启动
git clone https://github.com/Tencent/WeKnora.git
cd WeKnora
cp .env.example .env # 按注释编辑配置
docker compose pull # 拉取最新镜像
docker compose up -d # 启动核心服务
# 浏览器访问 http://localhost 即可使用
# 想用本地 Ollama?先 ollama serve 即可核心要点:
1. 国产模型支持尤其全(混元/豆包/智谱/DeepSeek/Qwen),国内落地友好
2. 全栈可替换:从 LLM 到向量库到存储,避免厂商锁定
3. Docker Compose 五命令起步,Helm 支持生产级 K8s
4. 私有云/离线部署保证数据完全不出域
8、总结
WeKnora 把"知识库"做成了一个会生长、可治理、多触达的企业资产:RAG 让它能被提问,Agent 让它能推理,Auto-Wiki 让它能自我整理,chunk/页面双层的修订历史让人工策展有抓手。
关键要点:
- 定位:腾讯开源企业级知识框架,RAG + ReAct Agent + Auto-Wiki(MIT)
- 独创:Auto-Wiki——agent 蒸馏文档成互链 wiki + 知识图谱 + 修订回滚
- 策展:chunk 可编辑带修订历史,检索质量可持续人工优化
- 生态:5 数据源同步 / 10 IM 渠道 / 20+ LLM / 8 向量库全可插拔
- 编程:scoped API key / MCP 29 工具 / CLI / DeepSeek Harness 插件
- 企业:4 级 RBAC + 审计 + AES-256 加密 + Langfuse 可观测 + K8s Helm
- 部署:docker compose 五命令起步,支持私有云离线,数据不出域
对于要搭建企业知识库、内部问答助手、团队 wiki 或"文档智能中枢"的团队而言,WeKnora 是国产开源里完成度罕见的选择——它不只有"上传文档问问题"的标配,更有 Auto-Wiki 这样的差异化能力和 chunk 级人工策展这种"懂 RAG 之痛"的细节设计;模型侧对国产 LLM 的全面适配、触达侧十个 IM 渠道、平台侧完整 RBAC 与可观测,都让它具备直接落地的条件。先用 docker compose 五条命令跑起来,导入一批飞书或 Notion 文档体验 RAG 问答,再打开 Wiki 模式看 agent 把散乱文档组织成体系——那一刻你会明白"Living Knowledge"不是口号:知识库不再是死水一潭,而是能被追问、被推理、被整理、被修订的活资产。