diff --git a/doc/doc_ch/PP-OCRv3_introduction.md b/doc/doc_ch/PP-OCRv3_introduction.md index 7ddf4a08a8..589970c649 100644 --- a/doc/doc_ch/PP-OCRv3_introduction.md +++ b/doc/doc_ch/PP-OCRv3_introduction.md @@ -23,31 +23,30 @@ PP-OCRv3系统pipeline如下: ## 2. 检测优化 -PP-OCRv3采用PP-OCRv2的[CML](https://arxiv.org/pdf/2109.03144.pdf)蒸馏策略,CML蒸馏包含一个蒸馏教师模型和两个蒸馏学生模型,在训练过程中,教师模型不参与训练,学生模型受到来自标签和教师模型的监督,同时两个学生模型互相学习。相比较PP-OCRv2,PP-OCRv3在蒸馏教师模型、蒸馏学生模型的精度提升两个方面进一步优化。 +PP-OCRv3采用PP-OCRv2的[CML](https://arxiv.org/pdf/2109.03144.pdf)蒸馏策略,CML蒸馏包含一个教师模型和两个学生模型,在训练过程中,教师模型不参与训练,学生模型受到来自标签和教师模型的监督,同时两个学生模型互相学习。相比较PP-OCRv2,PP-OCRv3在教师模型、学生模型的精度提升两个方面进一步优化。 PP-OCRv3 CML蒸馏训练框架图如下:
+
-PP-OCRv2的FPN通道数仅为96和24,如果直接用SEblock代替FPN中卷积会导致某些通道的特征被抑制,进而导致精度下降,RSEConv引入残差结构可以防止训练中包含重要特征的通道被抑制。RSE-FPN将PP-OCR检测模型的精度hmean从81.3%提升到84.5%。模型大小从3M变为3.6M。CPU预测速度从平均117ms/image变为124ms/image。
+PP-OCRv2的FPN通道数仅为96和24,如果直接用SEblock代替FPN中卷积会导致某些通道的特征被抑制,进而导致精度下降,RSEConv引入残差结构可以防止训练中包含重要特征的通道被抑制,使精度提升。RSE-FPN将PP-OCR检测模型的精度Hmean从81.3%提升到84.5%。模型大小从3M变为3.6M。CPU预测速度从平均117ms/image变为124ms/image。
-蒸馏学生模型的消融试验如下:
-|序号|策略|模型大小|hmean|Intel Gold 6148CPU+mkldnn预测耗时|
+消融实验如下:
+|序号|策略|模型大小|hmean|速度(cpu + mkldnn)|
|-|-|-|-|-|
-|0|PP-OCRv2|3M|81.3%|117ms|
-|1|+ teacher(dml)|3M|84.3%|117ms|
-|2|+ RSE-FPN|3.6M|85.4%|124ms|
+|0|PP-OCRv2|3M|83.2%|117ms|
+|1|PP-OCR server|49M|83.2%|171ms|
+|2|teacher1:DB-R50-LK-PAN|124M|85.0%|396ms|
+|3|teacher2:DB-R50-LK-PAN-DML|124M|86.0%|396ms|
+|4|DB-MV3-CML(teacher2)|3M|84.3%|117ms|
+|5|DB-MV3-RSE-FPN-CML(teacher2)|3.6M|85.4%|124ms|
+
+注: CPU速度测试硬件是Intel Gold 6148,paddlepaddle版本是2.2.2,速度耗时为305张图的平均预测时间,预测时开启MKLDNN加速。
diff --git a/doc/ppocr_v3/LKPAN.png b/doc/ppocr_v3/LKPAN.png
new file mode 100644
index 0000000000..6b16053623
Binary files /dev/null and b/doc/ppocr_v3/LKPAN.png differ
diff --git a/doc/ppocr_v3/teacher_dml.png b/doc/ppocr_v3/teacher_dml.png
index e6ca030506..ea09cacda8 100644
Binary files a/doc/ppocr_v3/teacher_dml.png and b/doc/ppocr_v3/teacher_dml.png differ