diff --git a/docs/version3.x/module_usage/table_classification.md b/docs/version3.x/module_usage/table_classification.md index 2ca5687c7d..0e2f9d037a 100644 --- a/docs/version3.x/module_usage/table_classification.md +++ b/docs/version3.x/module_usage/table_classification.md @@ -274,4 +274,6 @@ for res in output: ## 四、二次开发 -...... +由于 PaddleOCR 并不直接提供表格分类模块的训练,因此,如果需要训练表格分类模型,可以参考 [PaddleX 表格分类模块二次开发](https://paddlepaddle.github.io/PaddleX/latest/module_usage/tutorials/ocr_modules/table_classification.html#_4)部分进行训练。训练后的模型可以无缝集成到 PaddleOCR 的 API 中进行推理。 + +## 五、FAQ diff --git a/docs/version3.x/module_usage/table_structure_recognition.md b/docs/version3.x/module_usage/table_structure_recognition.md index ea9f0de4d0..13bcff35cb 100644 --- a/docs/version3.x/module_usage/table_structure_recognition.md +++ b/docs/version3.x/module_usage/table_structure_recognition.md @@ -290,4 +290,69 @@ for res in output: ## 四、二次开发 -...... +如果以上模型在您的场景上效果仍然不理想,您可以尝试以下步骤进行二次开发,此处以训练 `SLANet` 举例,其他模型替换对应配置文件即可。首先,您需要准备表格结构识别的数据集,可以参考[表格结构识别 Demo 数据](https://paddle-model-ecology.bj.bcebos.com/paddlex/data/table_rec_dataset_examples.tar)的格式准备,准备好后,即可按照以下步骤进行模型训练和导出,导出后,可以将模型快速集成到上述 API 中。此处以表格结构识别 Demo 数据示例。在训练模型之前,请确保已经按照[安装文档](xxx)安装了 PaddleOCR 所需要的依赖。 + + +## 4.1 数据集、预训练模型准备 + +### 4.1.1 准备数据集 + +```shell +# 下载示例数据集 +wget https://paddle-model-ecology.bj.bcebos.com/paddlex/data/table_rec_dataset_examples.tar +tar -xf table_rec_dataset_examples.tar +``` + +### 4.1.2 下载预训练模型 + +```shell +# 下载 SLANet 预训练模型 +wget https://paddle-model-ecology.bj.bcebos.com/paddlex/official_pretrained_model/SLANet_pretrained.pdparams +``` + +### 4.2 模型训练 + +PaddleOCR 对代码进行了模块化,训练 `SLANet` 识别模型时需要使用 `SLANet` 的[配置文件](https://github.com/PaddlePaddle/PaddleOCR/blob/main/configs/table/SLANet.yml)。 + + +训练命令如下: + +```bash +#单卡训练 (默认训练方式) +python3 tools/train.py -c configs/table/SLANet.yml \ + -o Global.pretrained_model=./SLANet_pretrained.pdparams +#多卡训练,通过--gpus参数指定卡号 +python3 -m paddle.distributed.launch --gpus '0,1,2,3' tools/train.py -c configs/table/SLANet.yml \ + -o Global.pretrained_model=./SLANet_pretrained.pdparams +``` + + +### 4.4 模型评估 + +您可以评估已经训练好的权重,如,`output/xxx/xxx.pdprams`,使用如下命令进行评估: + +```bash +# 注意将pretrained_model的路径设置为本地路径。若使用自行训练保存的模型,请注意修改路径和文件名为{path/to/weights}/{model_name}。 + # demo 测试集评估 + python3 tools/eval.py -c configs/table/SLANet.yml -o \ + Global.pretrained_model=output/xxx/xxx.pdprams + ``` + +### 4.5 模型导出 + +```bash + python3 tools/export_model.py -c configs/table/SLANet.yml -o \ + Global.pretrained_model=output/xxx/xxx.pdprams \ + save_inference_dir="./SLANet_infer/" + ``` + + 导出模型后,静态图模型会存放于当前目录的`./SLANet_infer/`中,在该目录下,您将看到如下文件: + ``` + ./SLANet_infer/ + ├── inference.json + ├── inference.pdiparams + ├── inference.yml + ``` +至此,二次开发完成,该静态图模型可以直接集成到 PaddleOCR 的 API 中。 + +## 五、FAQ diff --git a/docs/version3.x/pipeline_usage/table_recognition_v2.md b/docs/version3.x/pipeline_usage/table_recognition_v2.md index 31c41dabed..31a53899cc 100644 --- a/docs/version3.x/pipeline_usage/table_recognition_v2.md +++ b/docs/version3.x/pipeline_usage/table_recognition_v2.md @@ -39,6 +39,23 @@ comments: true 介绍 +SLANet推理模型/训练模型 +59.52 +103.08 / 103.08 +197.99 / 197.99 +6.9 M +SLANet 是百度飞桨视觉团队自研的表格结构识别模型。该模型通过采用 CPU 友好型轻量级骨干网络 PP-LCNet、高低层特征融合模块 CSP-PAN、结构与位置信息对齐的特征解码模块 SLA Head,大幅提升了表格结构识别的精度和推理速度。 + + +SLANet_plus推理模型/训练模型 +63.69 +140.29 / 140.29 +195.39 / 195.39 +6.9 M +SLANet_plus 是百度飞桨视觉团队自研的表格结构识别模型 SLANet 的增强版。相较于 SLANet,SLANet_plus 对无线表、复杂表格的识别能力得到了大幅提升,并降低了模型对表格定位准确性的敏感度,即使表格定位出现偏移,也能够较准确地进行识别。 + + + SLANeXt_wired 推理模型/训练模型 69.65 @@ -113,6 +130,22 @@ comments: true CPU推理耗时(ms)
[常规模式 / 高性能模式] 模型存储大小(M) 介绍 + +PP-OCRv5_server_det推理模型/训练模型 +83.8 +- / - +- / - +101 +PP-OCRv5 的服务端文本检测模型,精度更高,适合在性能较好的服务器上部署 + + +PP-OCRv5_mobile_det推理模型/训练模型 +79.0 +- / - +- / - +4.7 +PP-OCRv5 的移动端文本检测模型,效率更高,适合在端侧设备部署 + @@ -482,6 +515,15 @@ devanagari_PP-OCRv3_mobile_rec_infer.tar">推理模型/推理模型/训练模型 +83.2 +34.6244 / 10.3945 +510.57 / - +126.01 M +基于RT-DETR-L在包含中英文论文、多栏杂志、报纸、PPT、合同、书本、试卷、研报、古籍、日文文档、竖版文字文档等场景的自建数据集训练的更高精度版面区域定位模型 + + + PP-DocLayout-L推理模型/训练模型 90.4 34.6244 / 10.3945 @@ -508,7 +550,7 @@ devanagari_PP-OCRv3_mobile_rec_infer.tar">推理模型/您自己拥有的特定领域或应用场景的数据对现有模型进行进一步的微调,以提升通用表格识别v2产线的在您的场景中的识别效果。 -...... +由于通用表格识别v2产线包含若干模块,模型产线的效果如果不及预期,可能来自于其中任何一个模块。您可以对识别效果差的图片进行分析,进而确定是哪个模块存在问题,并参考以下表格中对应的微调教程链接进行模型微调。 + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
情形微调模块微调参考链接
表格分类错误表格分类模块链接
表格单元格定位错误表格单元格检测模块链接
表格结构识别错误表格结构识别模块链接
未能成功检测到表格所在区域版面区域检测模块链接
文本存在漏检文本检测模块链接
文本内容都不准文本识别模块链接
整图旋转/表格旋转矫正不准文档图像方向分类模块链接
图像扭曲矫正不准文本图像矫正模块暂不支持微调