




使用保留页面信息的矩形框和多边形,区分文档中的文本、表格、插图和参考文献区域。
通过与文档结构相匹配的共用本体,为区域添加类型和任务相关值。

即标注标题、文本块、表格、插图、图注和参考文献等页面元素的位置及语义类别,让模型学习文档结构。
可以。使用不同类别标记插图和图注区域,使其位置与语义角色保持明确。
可以。在原始页面视图中标注表格区域。如果训练任务需要更细的粒度,可定义行或字段标签。
可以。可选择文本可用于创建标注区域。对于扫描页面和图形内容,仍可使用视觉工具。
可以。共用区域分类体系可应用于报告、论文、表单和商业文档等不同 PDF。请在标注指南中纳入代表性版式。
标注前定义区域分类体系,在指南中纳入复杂版式,并审核不明确的边界或重叠内容。
原生文档工作流支持 PDF 文件。每个 PDF 始终作为一个工作项,团队浏览文档时,标注仍关联到原始页码。
审核人员检查页面区域及标签、处理评论,并通过已配置的工作流修正或拒绝工作结果。共用类别和属性可保持文档标注的一致性。
是的。Unitlab 统一导出格式将文档元数据和页码与标签、属性及支持的关系一并保留,供下游文档 AI 流水线使用。