From 6b296ee2b55772c6506bee7aeed97838bfed2e43 Mon Sep 17 00:00:00 2001 From: myhloli Date: Fri, 22 Nov 2024 17:45:14 +0800 Subject: [PATCH] fix(pdf_parse): improve OCR result handling - Add null check for OCR results to prevent errors on empty lists - Enhance robustness of OCR text processing in the magic-pdf project --- magic_pdf/pdf_parse_union_core_v2.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/magic_pdf/pdf_parse_union_core_v2.py b/magic_pdf/pdf_parse_union_core_v2.py index 6bdca58e..4247e913 100644 --- a/magic_pdf/pdf_parse_union_core_v2.py +++ b/magic_pdf/pdf_parse_union_core_v2.py @@ -222,7 +222,7 @@ def txt_spans_extract_v2(pdf_page, spans, all_bboxes, all_discarded_blocks, lang ocr_res = ocr_model.ocr(span_img, det=False) # logger.info(f"ocr_res: {ocr_res}") # logger.info(f"empty_span: {span}") - if len(ocr_res) > 0: + if ocr_res and len(ocr_res) > 0: if len(ocr_res[0]) > 0: ocr_text, ocr_score = ocr_res[0][0] if ocr_score > 0.5 and len(ocr_text) > 0: