1021 B
1021 B
name, description
| name | description |
|---|---|
| ocr | 光学字符识别 (OCR) 工具,支持从 PDF 和图片中提取中英文文本。适用场景:(1) 从扫描版 PDF 提取文字,(2) 识别图片中的文字,(3) 提取发票、合同等文档的文字内容 |
OCR 文字识别
本技能使用 PaddleOCR 进行文字识别,支持中文和英文。
快速开始
基础用法
直接对图片或 PDF 文件进行 OCR 识别:
from paddleocr import PaddleOCR
ocr = PaddleOCR(lang='ch')
result = ocr.predict("file_path.jpg")
依赖安装
首次使用前请安装依赖:
pip3 install paddlepaddle paddleocr
输出格式
识别结果返回 JSON 格式,包含:
rec_texts: 识别出的文字列表rec_scores: 每段文字的置信度分数
典型使用场景
- PDF 扫描件:先用 PyMuPDF 提取图片,再进行 OCR
- 图片文字识别:直接对图片进行 OCR
- 多页 PDF:逐页处理
脚本
常用脚本位于 scripts/ 目录下。