这里是差集:Docling 全量解析 text block 减去最终会进入正文的 block。优先人工检查 risk=high / medium。
layout_review.html excluded_blocks.json excluded_blocks.tsv final_body_blocks.tsv visual_assets.tsv original.pdf
{
"parsed_text_blocks": 91,
"final_body_blocks": 22,
"excluded_blocks": {
"count": 69,
"by_reason": {
"after_back_matter_stop": 21,
"docling_page_header": 18,
"outside_body_flow_caption": 9,
"first_page_author_or_affiliation": 6,
"body_heading": 4,
"first_page_metadata": 3,
"abstract_heading": 1,
"back_matter_heading": 1,
"before_body_started": 1,
"docling_caption": 1,
"document_web_address": 1,
"first_page_front_matter_heading": 1,
"first_page_summary": 1,
"front_matter_heading": 1
},
"by_role_guess": {
"page_header": 18,
"reference": 17,
"affiliation": 10,
"caption": 10,
"body_heading": 6,
"back_matter_heading": 2,
"abstract_heading": 1,
"body_candidate_excluded": 1,
"footnote": 1,
"front_matter_heading": 1,
"metadata": 1,
"page_footer": 1
},
"by_risk_level": {
"low": 68,
"medium": 1
},
"high_risk_count": 0,
"medium_risk_count": 1
},
"char_counts": {
"parsed_text_chars": 21558,
"final_body_chars": 15683,
"excluded_chars": 5875
}
}
{
"truncated": true,
"message": "Body extraction stopped at page 10 block #/texts/66: Acknowledgement. 21 following text blocks were excluded as after_back_matter_stop.",
"stop_trigger": {
"ref": "#/texts/66",
"page": 10,
"layout_order": 69,
"role_guess": "back_matter_heading",
"body_decision_reason": "back_matter_heading",
"text_preview": "Acknowledgement"
},
"first_truncated_block": {
"ref": "#/texts/67",
"page": 10,
"layout_order": 70,
"role_guess": "body_candidate_excluded",
"body_decision_reason": "after_back_matter_stop",
"text_preview": "Experiments at PLS were supported in part by POSTECH."
},
"truncated_block_count": 21,
"truncated_pages": [
10
],
"by_role_guess": {
"reference": 15,
"affiliation": 4,
"back_matter_heading": 1,
"body_candidate_excluded": 1
}
}
这些框显示被排除块,同时叠加真实图表资产框。青色虚线表示该 text block 被图表资产 caption 吸收;红色 STOP 是截断触发点,红色框是截断后被排除的块。