RAGFlow:深度文档理解的企业级 RAG 引擎
📖 简介
📝 详细介绍
RAG 的关键瓶颈:文档理解
绝大多数 RAG 系统都卡在同一个环节:文档解析。PDF 里的多栏布局、表格跨页、图片中的文字,这些用普通的文本切分(Text Splitter)根本处理不了。结果是:索引进去了,检索出来的却是残缺不全的片段,LLM 也就无法给出准确的回答。
RAGFlow 的切入点就是解决这个问题。它不是"先切文本再建索引"的思路,而是先还原文档的布局结构,再基于视觉理解做切片。
GitHub 数据
| 指标 | 数据 |
|---|---|
| Stars | 38,000+ |
| 主语言 | Python |
| 开源协议 | Apache 2.0 |
| 最近更新 | 2026 年 7 月 |
| 所属组织 | InfiniFlow |
核心功能解析
深度文档解析(DeepDoc)
RAGFlow 内置的 DeepDoc 模块,不只是做 OCR——它对文档做版面分析(Layout Analysis):
- 识别标题层级,构建目录树
- 区分正文、页眉页脚、脚注
- 解析表格结构(支持合并单元格)
- 提取图片中的文字(OCR)
处理后的文档以 JSON 结构保存——保留原始的布局信息。这让 RAG 的检索能做到"根据第三章第二节的内容回答",而不是"根据第 3 个切片的片段回答"。
可视化配置管线
RAGFlow 自带 Web UI,不需要写代码就能搭建完整的 RAG 管线:
1. 上传文档(PDF / Word / Excel / PPT / 图片)
2. 选择解析模板(通用 / 论文 / 表格密集型 / 法律合同)
3. 配置切片策略(大小 / 重叠率 / 是否保留标题)
4. 选择 Embedding 模型(内置 BGE / 通义 / OpenAI 等)
5. 选择对话模型(Ollama 本地 / OpenAI / DeepSeek)
6. 上线知识库
全程鼠标操作,IT 支持人员也能独立完成。
混合检索
内置稠密+稀疏混合检索(Dense + Sparse Retrieval),融合向量相似度和 BM25 关键词匹配。在中文企业文档测试中,混合检索的 Recall@5 比单一向量检索高出 15-20%。
快速上手
# 使用 Docker 一键部署
git clone https://github.com/infiniflow/ragflow.git
cd ragflow
docker compose -f docker/docker-compose.yml up -d
# 浏览器访问 http://localhost:9380
# 默认账号: admin / admin
技术架构亮点
RAGFlow 的管线采用了流水线并行架构。文档解析、切片、向量化三个步骤可以分别由不同的 Worker 处理,中间通过消息队列(RabbitMQ)解耦。这意味着:
- 上传 1000 份 PDF 不会阻塞系统
- 解析完成的文档立即进入切片队列
- 切片完成后立即触发向量化
对于中文文档,RAGFlow 做了特别优化——支持多种中文分词器,对中英文混排、竖排文字、手写体都有专门的预处理策略。
同类对比
| 方案 | 文档理解深度 | 中文支持 | Web UI | 部署难度 |
|---|---|---|---|---|
| RAGFlow | ★★★★★ | ★★★★★ | ★★★★ | ★★★ |
| LangChain RAG | ★★ | ★★★ | ★(需自建) | ★★ |
| LlamaIndex | ★★★ | ★★ | ★(需自建) | ★★ |
| AnythingLLM | ★★★ | ★★ | ★★★★★ | ★★★★★ |
总结
RAGFlow 的差异化价值在于:它不把文档当文本处理,而是当版面处理。对于需要处理复杂 PDF、表格、多栏布局的企业场景(法律合同审查、金融财报分析、学术论文问答),RAGFlow 是目前开源社区里最好的选择。推荐给:企业知识库搭建者、文档密集型行业的 AI 应用开发者、中文 NLP 从业者。
AI 项目推荐
智能体- 标签
- #RAG #文档理解 #知识库 #企业搜索 #向量检索
- 浏览
- 👁️ 17
- 发布日期
- 2026-07-21