跳过主要内容
广告OpenFree logo推广你的产品触达更多潜在用户,助力产品增长与收益提升。投放广告
Favicon of PaddleOCR

PaddleOCR

Free 等级项目

PaddleOCR 是一款强大、轻量的 OCR 与文档解析工具包,可将 PDF 和图像转换为结构化、可供 LLM 使用的数据。它支持 100 多种语言、JSON 和 Markdown 输出,并帮助构建 RAG 和 Agentic 应用。

访问 PaddlePaddle/PaddleOCR

项目简介

PaddleOCR 是一款 OCR 工具包与文档 AI 引擎,可将 PDF 和图像转换为结构化、可供 LLM 使用的数据。它提供高精度文本识别、文档解析和多语言支持,用于构建智能 RAG 和 Agentic 应用。

核心功能

  • 智能文档解析可将复杂 PDF 和图像转换为 Markdown 或 JSON,具备结构感知转换和细粒度坐标;PaddleOCR-VL 和 PP-StructureV3 支持文本、公式、表格、图表、印章和古籍识别;通用文本识别支持 100 多种语言,PP-OCRv6 以单一模型覆盖 50 种语言,无需切换模型;PP-OCRv6 相比 PP-OCRv5 检测提升 4.6%,识别提升 5.1%,端到端 CPU 推理加速 5.2 倍;开发者生态集成 Dify、RAGFlow、Pathway 和 Cherry Studio,并支持构建 LLM

适用场景

  • 构建需要准确解析 PDF、图像和复杂文档以供 LLM 摄入的 RAG 管道;将扫描文档、表格、公式和图表转换为 Markdown 或 JSON,用于结构化数据工作流;跨 100 多种语言处理多语言文档,包括中文、英文、日文、韩文、阿拉伯文及其他文字;通过 Python、C++、C#、Java 或基于浏览器的推理将 OCR 嵌入应用。

快速开始

  • 在官网试用在线体验中心和 API,无需设置。本地部署时,根据需要参阅 PP-OCR、PaddleOCR-VL 或 PP-StructureV3 文档。

部署与要求

  • Python 3.8–3.12;操作系统支持 Linux、Windows 和 macOS;硬件支持 CPU、GPU、XPU 和 NPU。一键部署支持 NVIDIA GPU、Intel CPU、昆仑芯 XPU 及多种 AI 加速器。高性能推理支持 CUDA 12,可使用 Paddle Inference 或 ONNX Runtime 后端。

采用前须知

  • 许可证:Apache-2.0。在使用、修改或分发项目前,请确认其具体条款。

评论

登录 后发表评论。

更多类似 PaddleOCR 的项目

Favicon of anydoc

anydoc

Free 等级项目星标数: 22.1K

将各类文档转换为 GitHub 风格 Markdown 的 Rust 库

文档解析与 OCR

anydoc 是 Firecrawl 开发的开源 Rust 库,可将 Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV 和 PDF 转换为整洁的 GitHub 风格 Markdown,并提供 Node.js、Python、浏览器和 CLI 绑定。