文档视觉问答数据标注

创建经过审核的文档示例,将问题与答案关联到可见的源证据。使用文档区域、可选文本与已配置属性准备 DocVQA 训练数据。
Document question-answering collage with a highlighted invoice total and matching Question and Answer properties.

让每个答案都有文档依据

从发票、记录与表单构建问答示例,并保留审核人员验证每个答案所需的证据。
An invoice total region has Question and Answer text properties on its evidence annotation.

答案证据区域

标记包含答案的文档区域,例如发票总额。将问题与答案作为已配置的文本属性保存在证据标注上。
A selectable PDF date span provides the answer to a shipment-date question.

可选文本答案

当 PDF 包含可用文本层时,选择答案文本片段。在标注问答示例时保留确切值及周围的文档上下文。
The checked Collection option is marked as evidence for a document question.

表单与版面证据

标注支持答案的可见表单字段或已选选项。问题应限定为能够从文档文本与版面中确定的信息。
A reviewer checks the exact invoice total against its Question, Answer and Evidence annotation.

问答审核

结合检查问题、答案值与源证据。将不匹配的值或缺乏依据的答案区域退回修正,再接受示例。

AI 团队为何选择 Unitlab

在准备文档视觉问答数据时,让源数据、标注规则和审核决策保持关联。
15X
更快的数据标注
60%
节省 AI 工程师的时间
5X
降低 AI 开发成本

文档问答标注类型

将明确的问答属性与锚定于源文档的证据结合。
An invoice total region has Question and Answer text properties on its evidence annotation.

带文本属性的证据区域

文档区域标识支持证据。已配置的 Question(问题)和 Answer(答案)文本属性,在同一标注上记录问题及经过审核的回答。

文档文本片段

可选择的 PDF 文本可标注为答案片段,让提取的值关联到确切源文本,而非脱离上下文的转录内容。

A selectable PDF date span provides the answer to a shipment-date question.

文档视觉问答常见问题

什么是文档视觉问答?

DocVQA 是模型回答文档图像相关问题的文档理解任务。标注工作为训练或评估准备问题、答案值及支持答案的源证据。

Unitlab 如何表示问题与答案?

在证据标注上配置 Question(问题)和 Answer(答案)等文本属性。标注人员标记源区域或受支持的文本片段,并输入项目结构要求的值。

能否直接从 PDF 中选择答案?

可以。当 PDF 包含可用文本层时,可通过受支持的文本选择将答案锚定于文档。对于没有可选文本的扫描页面,使用视觉证据区域与已配置的答案文本。

哪些文档适合此工作流?

适用示例包括能够根据内容回答问题的发票、收据、表单和业务记录。在标注前定义文档范围与问题规则,保持证据要求一致。

应如何编写问题?

编写能够由所提供文档支持答案的问题。对于抽取式示例,确定确切答案值,并标注将其与相邻字段区分开的证据。

表单字段与已选选项能否提供证据?

可以。视觉区域可框选表单字段或已选选项,并通过问题与答案属性描述示例。审核人员应同时检查文本与可见的选择状态。

Unitlab 会自动生成答案吗?

此处描述的工作流记录已提供或人工编写的问题及经过审核的答案,不预设自动生成问题、文档推理或答案抽取能力。

审核人员如何发现缺乏依据的答案?

审核人员将答案属性与已标注的源区域或文本片段及问题进行对照。错误值、含糊问题或缺失证据的示例可退回返工。

如何保持文档示例一致?

使用共享标注类别、必填属性和清晰的问题编写指南。审核代表性示例,并对不同文档版面应用相同的证据规则。