面向文档 AI 的版面标注

标注 PDF 页面中的标题、文本块、表格、插图和参考文献。构建经过审核的版面数据集,保留各个元素的位置及其角色。
Document Layout Analysis example with source-data annotations and contextual photographs.

让模型学习页面结构

为报告、论文、表单及其他 PDF 中的内容元素创建版面标签。
Multi-page technical PDF with structured text, figure, and table annotations.

标题与文本块

使用一致的页面版式分类体系,标注标题、章节标题、段落及其他文本块。
PDF table with table, header, and row region labels.

表格与重复结构

识别表格区域以及任务定义的行或字段区域,同时保留它们在原始页面中的位置。
Scientific PDF figure and caption labeled as distinct layout regions.

插图与图注

分别标记插图和图注区域,让文档模型学习其位置与语义角色。
PDF references and footnote labeled as distinct layout elements.

参考文献与脚注

在内容密集的文档页面中,将参考文献条目和脚注区域识别为不同的版面元素。

AI 团队为何选择 Unitlab

将文档标注、共用本体、专家审核和数据集交付整合到统一工作流,让团队专注于准备有价值的训练数据。
15X
加快文档标注
60%
释放 AI 工程师时间
5X
降低 AI 开发成本

文档版面分析的标注类型

将保留页面信息的视觉区域与结构化标签、文本值及属性结合,满足文档任务需求。
Multi-page technical PDF with structured text, figure, and table annotations.

版面区域标签

使用保留页面信息的矩形框和多边形,区分文档中的文本、表格、插图和参考文献区域。

区域属性

通过与文档结构相匹配的共用本体,为区域添加类型和任务相关值。

Scientific PDF figure and caption labeled as distinct layout regions.

文档版面分析常见问题

什么是文档版面分析标注?

即标注标题、文本块、表格、插图、图注和参考文献等页面元素的位置及语义类别,让模型学习文档结构。

能否标注插图与图注?

可以。使用不同类别标记插图和图注区域,使其位置与语义角色保持明确。

能否在不扁平化 PDF 的情况下标注表格?

可以。在原始页面视图中标注表格区域。如果训练任务需要更细的粒度,可定义行或字段标签。

PDF 中可选择的文本能否帮助创建标签?

可以。可选择文本可用于创建标注区域。对于扫描页面和图形内容,仍可使用视觉工具。

同一套版面结构定义能否覆盖不同文档类型?

可以。共用区域分类体系可应用于报告、论文、表单和商业文档等不同 PDF。请在标注指南中纳入代表性版式。

团队如何保持密集文档版面的标注一致性?

标注前定义区域分类体系,在指南中纳入复杂版式,并审核不明确的边界或重叠内容。

Unitlab 支持哪种文档格式?

原生文档工作流支持 PDF 文件。每个 PDF 始终作为一个工作项,团队浏览文档时,标注仍关联到原始页码。

如何审核文档标注?

审核人员检查页面区域及标签、处理评论,并通过已配置的工作流修正或拒绝工作结果。共用类别和属性可保持文档标注的一致性。

导出是否保留文档页面上下文?

是的。Unitlab 统一导出格式将文档元数据和页码与标签、属性及支持的关系一并保留,供下游文档 AI 流水线使用。