文档标注平台

用于文档 AI 的 PDF 和文档标注平台

使用 OCR 感知区域、文本实体、关系和受控质量保证为 Document AI 标注 PDF、发票、表单、表格和扫描文档。

文档标注功能

复杂文档标注所需的一切

导航多页 PDF、选择本机文本、创建页面感知区域、应用文档本体并在不丢失上下文的情况下查看每个更改。

Three consecutive native PDF pages with structured annotations on titles, text, subtitles, tables, and figures, with page 613 active.
01·原生PDF

原生 PDF 标注

直接对原始多页 PDF 进行标注,无需将页面转换为图像文件。导航页面,同时保留文档标识、标注、审阅状态、历史记录和发布上下文。

原生 PDF
多页标注
文档上下文
Close-up native PDF content showing lavender-selected text, an amber-highlighted embedded chart, and mint-selected table cells.
02·PDF内容

可选择的 PDF 文本、图像和表格

直接选择原生 PDF 文本、图像、表格和其他嵌入页面内容。正常复制文本或将所选内容转换为结构化、页面感知的标注。

Invoice with single annotation labels for document text fields, dates, line-item table columns, subtotal, tax, and total.
03·OCR与提取

结构化 OCR 和文本提取

查看发票的 OCR 输出,标记每个文本字段和行项目表,并使用页面感知类、属性和关系保留提取的值。

Video Annotation ontology interface preserved exactly with document-specific Invoice, Line Item, attributes, Relation, and Item Properties use cases.
04·结构

文档本体和关系

使用嵌套类属性、项目属性和关系对发票、行项目、条款、各方和其他文档概念进行建模,同时保留页面和文档上下文。

Page 2 of an invoice with clear page-aware text selection, review, approval, and save history lanes.
05 · 背景

页面感知历史和回顾

在一个文档级历史记录中查看页面标识、所选文本、标签、关系、评论、问题、保存事件和批准决策。

Overview and focused navigation for a 2,410-page PDF, with page 836 active.
示例文档2,410 页
06 · 规模

大型 PDF,一个文档上下文

使用缩略图和页脚控件浏览 2,410 页的 PDF,同时保留页外标注、项目属性、审阅状态和完整的文档历史记录。

页面缩略图单独的工作项控件

为什么 AI 团队选择 Unitlab 进行文档标注

通过人工智能辅助自动化、可扩展的工作流程和更低的运营成本,更快地标注复杂的文档数据集。

15倍
更快的文档标注
90%
自动文档标注
10倍
降低标注成本
支持的文档标注类型

所有文档标注类型 在一个平台上。

在 PDF 页面上标记文本和实体、页面感知区域、文档布局、表格、OCR 字段、分类、图形、文档属性和关系。

01
文本和图像区域

文本/实体标注

使用可重用的类、属性和页面上下文来标记可选择的文本范围和文档实体。

02
像素级蒙版

边界框/区域

使用页面感知边界框标记文本、字段、图像或可视区域。

03
精确的边界

布局区域

为 PDF 页面上的标题、段落、部分、列和其他布局区域添加标签。

04
姿势结构

表格标注

标注表格、行、列、单元格、标题和行项目关系。

05
路径和边缘

OCR字段标注

查看扫描或本机 PDF 上的 OCR 文本和标签字段、值以及提取的文本区域。

06
里程碑式的精度

分类

分配文档类型、页面类型、意图、状态或其他整个项目标签。

07
定向体积

图像/图形区域

标记图形、图表、签名、徽标和嵌入图像区域。

08
文档级上下文

项目属性

描述完整的 PDF,包括来源、质量、类别和其他文档级上下文。

09
对象连接

关系

明确连接子句、各方、可视区域、属性和其他文档对象。

文档数据集管理和标注工作流程

整理文档数据并自动化标注工作流程。

搜索、版本控制和检查文档数据集,连接 AI 模型,并通过审核和批准移动标注。

Three successive Unitlab dataset versions containing invoice, climate report, field manual, and procurement PDF pages.
版本

数据集版本

创建 PDF 数据集、页面标注和精选集合的版本化快照,同时保持每个版本的可追溯性。

Unitlab semantic search for termination notice periods across six varied PDF document results.
发现

语义搜索

使用自然语言查询搜索文档数据集,并仅返回相关的 PDF、页面或案例以进行管理和审查。

Document embedding clusters with an invoice and procurement table selected for review.
检查

嵌入视图

在训练之前探索相似的文档和页面、集群、异常值、重复项和标签问题。

Existing Unitlab integrated workflow connecting Clause Extraction, annotation, review, approval, and rejected-item rework.
编排

集成工作流程

构建在一个连续循环中连接模型、标注、审查和质量保证的工作流程。减少交接并保持数据集从标记到批准的过程。

Bring your Document model into Unitlab’s annotation workflow
整合

带上您的文档模型

连接文档模型以进行预标记或提取,然后通过人工更正、审查和批准来进行预测。

问题,已回答

文档标注平台常见问题解答

关于 Unitlab 中的 PDF 标注、OCR 审查、文档标签、布局和表格标注、文本提取、本体、质量工作流程和文档 AI 数据集的答案。

与 Unitlab 团队交谈
What document annotation types does Unitlab support?+

Unitlab 支持原生 PDF 文本和实体标注、页面感知区域、布局区域、表格、OCR 字段、分类、图形、文档属性和关系。

文档标注文档
How does native PDF page navigation work in Unitlab?+

一份上传的 PDF 仍然是一个工作项目。顶部中心的上一个和下一个控件可更改工作项目,而底部页脚可更改当前 PDF 内的页面,而不会丢失页外标注。

PDF 页面导航文档
Can Unitlab select and annotate native PDF text?+

是的。当本机文本图层可用时,“选择 PDF 文本”可启用正常选择和复制。选定的文本矩形可以成为可编辑的页面感知边界区域;扫描的 PDF 可能需要不同的 OCR 处理。

PDF 文本选择文档
How do document ontologies, properties, and relations work?+

文档本体定义类、嵌套属性、项目属性和关系。每个文本或视觉标注都保留其页面上下文,而文档级属性则描述完整的 PDF。

属性和关系文档
How does Unitlab manage document annotation quality and review?+

可配置的工作流程通过标注、审查、返工和批准来路由文档任务。说明、作业、评论、问题、标注历史记录、数据集版本和发布使个别专家和企业团队的质量决策保持可追溯性。

标注和审查文档
Can teams use their own AI models for document pre-labeling?

是的。 Unitlab 可以将自定义模型引入标注工作流程以生成预标签和预测。标注者审查并纠正模型输出,而不是从零开始,而人工批准仍然是受控质量流程的一部分。

模型集成文档
Can Unitlab curate, annotate, and version document datasets in one platform?

是的。团队可以使用元数据过滤器、语义搜索、嵌入、相似性和异常值发现来管理文档数据,然后标注选定的样本、审查结果并发布受控数据集版本以进行可重复的人工智能开发。

数据集管理文档
文档标注平台

使用 Unitlab 构建生产就绪的文档数据集

在一个 AI 辅助工作区中标注、审阅和管理本机 PDF 数据。从可选择的文本和页面感知区域转移到受监管的批准和版本化版本,而不会丢失文档上下文。