面向结构化字段提取的训练数据

将 CSV 记录中的文本转化为精确且保留字段语义的标签。标注实体片段、描述表头语义并连接记录内的值,为提取模型准备可靠训练数据。
Operational records collage with labeled quantity, item, location and organization spans.

字段提取数据整理与标注

保留业务记录的原始结构,准备字段提取样本。捕捉精确文本、字段角色与关系,让模型训练同时利用值及其上下文。
Exact Cell Text Spans in a native CSV record annotation example

精确的单元格文本片段

标记提取模型需要学习的精确词语与字符范围。保留每个标签的原始列及字符偏移。
Column and Header Semantics in a native CSV record annotation example

列与表头语义

标注当前记录中的列名或选定表头文本。结合字段包含的值与实体,描述字段的角色。
Relationships Across Fields in a native CSV record annotation example

跨字段关系

使用带类型的关系连接记录内的已标注实体与表头标记,明确表达孤立文本片段无法直接体现的关联。
Reviewed Structured Exports in a native CSV record annotation example

经过审核的结构化导出

结合原始字段上下文检查提取标签,通过审核修正错误,并将记录及受支持的标注导出为 JSONL。

信息提取 AI 团队为何选择 Unitlab

从源记录到导出数据集,确保提取样本精确、保留字段语义且可供审核。
15X
加快记录标注
60%
释放 AI 工程师的时间
5X
降低 AI 开发成本

字段提取的标注类型

结合单元格实体、列与表头标签、记录分类和关系,描述提取模型需要学习的值。
Service record with Product and Issue entity labels and record-level intent and priority properties.

单元格实体与记录属性

高亮 CSV 字段中的精确文本,并用共享属性对整条记录进行分类。将每个标签与源字段和记录上下文保持关联。

记录内跨字段关系

在同一记录的不同字段之间连接已标注实体与表头标记。使用带类型的关系表达关联,并结合原始证据进行审核。

Service record linking a product to its issue and the issue to a shipped replacement resolution.

结构化字段提取常见问题

什么是结构化字段提取训练数据?

这是一组带有明确标签的源记录,说明应提取哪些文本、字段的含义以及实体之间的关系。经过审核的样本可支持下游信息提取模型。

此工作流可以使用哪种文件格式?

在表格行模式中使用 CSV 文件。每行作为独立记录呈现,保留列名与值,供标注和审核。

可以标注单元格值中的一部分吗?

可以。实体标注可精确标记文本字段中的字符片段。导出会保留每个受支持实体片段的列标识及起止位置。

可以标注列名与表头文本吗?

可以。可在当前记录中标注列名,或选择表头中的文本片段。这些标签会随该记录的标注历史一起保存。

标注一个表头会自动更新所有行吗?

表头标注的作用范围是各条记录的标注历史。相同标签不会自动传播到源 CSV 中的所有行。

可以连接不同字段中的实体吗?

可以。根据本体中的关系定义,可在同一记录的不同字段之间连接已标注单元格实体、列标签与表头片段。

审核员如何检查提取字段?

审核员同时检查源值、实体片段、字段标签与属性。上下文评论和已配置的返工路径帮助他们在批准前解决错误。

此表格工作流会对扫描文档执行 OCR 吗?

此工作流标注 CSV 记录中已有的文本。当源数据为 PDF 或其他文档资产时,可使用 Unitlab 独立的文档标注工作流处理文档类任务。

已标注表格数据的导出包含哪些内容?

JSONL 导出包含行值与列结构、已标注实体、受支持的关系和记录属性。导出的标注保留原始字段上下文与字符片段。

需要协助设计结构化字段提取数据工作流?联系 Unitlab