mirror of
https://github.com/opendatalab/MinerU.git
synced 2026-09-24 23:10:23 +08:00
feat: rename flash formula number functions to hybrid for consistency
This commit is contained in:
@@ -26,7 +26,7 @@ from mineru.backend.pipeline.model_init import (
|
||||
run_ocr_inference,
|
||||
)
|
||||
from mineru.backend.pipeline.model_list import AtomicModel
|
||||
from mineru.backend.utils.formula_number import optimize_medium_formula_number_blocks
|
||||
from mineru.backend.utils.formula_number import optimize_hybrid_formula_number_blocks
|
||||
from mineru.backend.vlm.vlm_analyze import (
|
||||
ModelSingleton,
|
||||
aio_predictor_execution_guard,
|
||||
@@ -1080,7 +1080,7 @@ def doc_analyze(
|
||||
not_extract_list=None if _vlm_ocr_enable else not_extract_list,
|
||||
image_analysis=image_analysis,
|
||||
)
|
||||
optimize_medium_formula_number_blocks(window_model_list)
|
||||
optimize_hybrid_formula_number_blocks(window_model_list)
|
||||
if _vlm_ocr_enable:
|
||||
_apply_vlm_ocr_det_sidecars_for_window(
|
||||
images_pil_list,
|
||||
@@ -1297,7 +1297,7 @@ async def aio_doc_analyze(
|
||||
not_extract_list=None if _vlm_ocr_enable else not_extract_list,
|
||||
image_analysis=image_analysis,
|
||||
)
|
||||
optimize_medium_formula_number_blocks(window_model_list)
|
||||
optimize_hybrid_formula_number_blocks(window_model_list)
|
||||
if _vlm_ocr_enable:
|
||||
await asyncio.to_thread(
|
||||
_apply_vlm_ocr_det_sidecars_for_window,
|
||||
|
||||
@@ -124,11 +124,11 @@ def _downgrade_formula_number_to_text(block: Block) -> None:
|
||||
block["type"] = BlockType.TEXT
|
||||
|
||||
|
||||
def _append_flash_formula_number_tag(
|
||||
def _append_hybrid_formula_number_tag(
|
||||
equation_block: Block,
|
||||
formula_number_block: Block,
|
||||
) -> None:
|
||||
"""将公式编号写入Hybrid flash的VLM行间公式内容。"""
|
||||
"""将公式编号写入Hybrid的VLM行间公式内容。"""
|
||||
equation_block["content"] = build_tagged_formula_content(
|
||||
equation_block.get("content", ""),
|
||||
formula_number_block,
|
||||
@@ -148,19 +148,14 @@ def optimize_formula_number_blocks(pdf_info_list: Iterable[Block]) -> None:
|
||||
)
|
||||
|
||||
|
||||
def optimize_flash_formula_number_blocks(model_list: Iterable[list[Block]]) -> None:
|
||||
"""按统一相邻规则处理Hybrid flash的VLM公式编号块。"""
|
||||
def optimize_hybrid_formula_number_blocks(model_list: Iterable[list[Block]]) -> None:
|
||||
"""按统一相邻规则处理Hybrid的VLM公式编号块。"""
|
||||
for page_model_list in model_list:
|
||||
optimized_blocks = _optimize_formula_number_sequence(
|
||||
page_model_list or [],
|
||||
lambda block: block.get("type") == BlockType.FORMULA_NUMBER,
|
||||
lambda block: block.get("type") == BlockType.EQUATION,
|
||||
_append_flash_formula_number_tag,
|
||||
_append_hybrid_formula_number_tag,
|
||||
_downgrade_formula_number_to_text,
|
||||
)
|
||||
page_model_list[:] = optimized_blocks
|
||||
|
||||
|
||||
def optimize_medium_formula_number_blocks(model_list: Iterable[list[Block]]) -> None:
|
||||
"""按 Hybrid medium effort 规则处理 VLM 公式编号块。"""
|
||||
optimize_flash_formula_number_blocks(model_list)
|
||||
|
||||
Reference in New Issue
Block a user