diff --git a/mineru/backend/hybrid/hybrid_analyze.py b/mineru/backend/hybrid/hybrid_analyze.py index 486f8e43..95f333c2 100644 --- a/mineru/backend/hybrid/hybrid_analyze.py +++ b/mineru/backend/hybrid/hybrid_analyze.py @@ -26,7 +26,7 @@ from mineru.backend.pipeline.model_init import ( run_ocr_inference, ) from mineru.backend.pipeline.model_list import AtomicModel -from mineru.backend.utils.formula_number import optimize_medium_formula_number_blocks +from mineru.backend.utils.formula_number import optimize_hybrid_formula_number_blocks from mineru.backend.vlm.vlm_analyze import ( ModelSingleton, aio_predictor_execution_guard, @@ -1080,7 +1080,7 @@ def doc_analyze( not_extract_list=None if _vlm_ocr_enable else not_extract_list, image_analysis=image_analysis, ) - optimize_medium_formula_number_blocks(window_model_list) + optimize_hybrid_formula_number_blocks(window_model_list) if _vlm_ocr_enable: _apply_vlm_ocr_det_sidecars_for_window( images_pil_list, @@ -1297,7 +1297,7 @@ async def aio_doc_analyze( not_extract_list=None if _vlm_ocr_enable else not_extract_list, image_analysis=image_analysis, ) - optimize_medium_formula_number_blocks(window_model_list) + optimize_hybrid_formula_number_blocks(window_model_list) if _vlm_ocr_enable: await asyncio.to_thread( _apply_vlm_ocr_det_sidecars_for_window, diff --git a/mineru/backend/utils/formula_number.py b/mineru/backend/utils/formula_number.py index ab22ce2a..9927a4ca 100644 --- a/mineru/backend/utils/formula_number.py +++ b/mineru/backend/utils/formula_number.py @@ -124,11 +124,11 @@ def _downgrade_formula_number_to_text(block: Block) -> None: block["type"] = BlockType.TEXT -def _append_flash_formula_number_tag( +def _append_hybrid_formula_number_tag( equation_block: Block, formula_number_block: Block, ) -> None: - """将公式编号写入Hybrid flash的VLM行间公式内容。""" + """将公式编号写入Hybrid的VLM行间公式内容。""" equation_block["content"] = build_tagged_formula_content( equation_block.get("content", ""), formula_number_block, @@ -148,19 +148,14 @@ def optimize_formula_number_blocks(pdf_info_list: Iterable[Block]) -> None: ) -def optimize_flash_formula_number_blocks(model_list: Iterable[list[Block]]) -> None: - """按统一相邻规则处理Hybrid flash的VLM公式编号块。""" +def optimize_hybrid_formula_number_blocks(model_list: Iterable[list[Block]]) -> None: + """按统一相邻规则处理Hybrid的VLM公式编号块。""" for page_model_list in model_list: optimized_blocks = _optimize_formula_number_sequence( page_model_list or [], lambda block: block.get("type") == BlockType.FORMULA_NUMBER, lambda block: block.get("type") == BlockType.EQUATION, - _append_flash_formula_number_tag, + _append_hybrid_formula_number_tag, _downgrade_formula_number_to_text, ) page_model_list[:] = optimized_blocks - - -def optimize_medium_formula_number_blocks(model_list: Iterable[list[Block]]) -> None: - """按 Hybrid medium effort 规则处理 VLM 公式编号块。""" - optimize_flash_formula_number_blocks(model_list)