
原生 PDF 标注
直接对原始多页 PDF 进行标注,无需将页面转换为图像文件。导航页面,同时保留文档标识、标注、审阅状态、历史记录和发布上下文。
使用 OCR 感知区域、文本实体、关系和受控质量保证为 Document AI 标注 PDF、发票、表单、表格和扫描文档。
导航多页 PDF、选择本机文本、创建页面感知区域、应用文档本体并在不丢失上下文的情况下查看每个更改。

直接对原始多页 PDF 进行标注,无需将页面转换为图像文件。导航页面,同时保留文档标识、标注、审阅状态、历史记录和发布上下文。

直接选择原生 PDF 文本、图像、表格和其他嵌入页面内容。正常复制文本或将所选内容转换为结构化、页面感知的标注。

查看发票的 OCR 输出,标记每个文本字段和行项目表,并使用页面感知类、属性和关系保留提取的值。

使用嵌套类属性、项目属性和关系对发票、行项目、条款、各方和其他文档概念进行建模,同时保留页面和文档上下文。

在一个文档级历史记录中查看页面标识、所选文本、标签、关系、评论、问题、保存事件和批准决策。

使用缩略图和页脚控件浏览 2,410 页的 PDF,同时保留页外标注、项目属性、审阅状态和完整的文档历史记录。
通过人工智能辅助自动化、可扩展的工作流程和更低的运营成本,更快地标注复杂的文档数据集。
在 PDF 页面上标记文本和实体、页面感知区域、文档布局、表格、OCR 字段、分类、图形、文档属性和关系。
使用可重用的类、属性和页面上下文来标记可选择的文本范围和文档实体。
使用页面感知边界框标记文本、字段、图像或可视区域。
为 PDF 页面上的标题、段落、部分、列和其他布局区域添加标签。
标注表格、行、列、单元格、标题和行项目关系。
查看扫描或本机 PDF 上的 OCR 文本和标签字段、值以及提取的文本区域。
分配文档类型、页面类型、意图、状态或其他整个项目标签。
标记图形、图表、签名、徽标和嵌入图像区域。
描述完整的 PDF,包括来源、质量、类别和其他文档级上下文。
明确连接子句、各方、可视区域、属性和其他文档对象。
搜索、版本控制和检查文档数据集,连接 AI 模型,并通过审核和批准移动标注。

创建 PDF 数据集、页面标注和精选集合的版本化快照,同时保持每个版本的可追溯性。

使用自然语言查询搜索文档数据集,并仅返回相关的 PDF、页面或案例以进行管理和审查。

在训练之前探索相似的文档和页面、集群、异常值、重复项和标签问题。

构建在一个连续循环中连接模型、标注、审查和质量保证的工作流程。减少交接并保持数据集从标记到批准的过程。
连接文档模型以进行预标记或提取,然后通过人工更正、审查和批准来进行预测。
从发票、表格、合同、报告和技术 PDF 创建结构化、可供审阅的数据集。
关于 Unitlab 中的 PDF 标注、OCR 审查、文档标签、布局和表格标注、文本提取、本体、质量工作流程和文档 AI 数据集的答案。
与 Unitlab 团队交谈Unitlab 支持原生 PDF 文本和实体标注、页面感知区域、布局区域、表格、OCR 字段、分类、图形、文档属性和关系。
文档标注文档一份上传的 PDF 仍然是一个工作项目。顶部中心的上一个和下一个控件可更改工作项目,而底部页脚可更改当前 PDF 内的页面,而不会丢失页外标注。
PDF 页面导航文档是的。当本机文本图层可用时,“选择 PDF 文本”可启用正常选择和复制。选定的文本矩形可以成为可编辑的页面感知边界区域;扫描的 PDF 可能需要不同的 OCR 处理。
PDF 文本选择文档文档本体定义类、嵌套属性、项目属性和关系。每个文本或视觉标注都保留其页面上下文,而文档级属性则描述完整的 PDF。
属性和关系文档可配置的工作流程通过标注、审查、返工和批准来路由文档任务。说明、作业、评论、问题、标注历史记录、数据集版本和发布使个别专家和企业团队的质量决策保持可追溯性。
标注和审查文档是的。 Unitlab 可以将自定义模型引入标注工作流程以生成预标签和预测。标注者审查并纠正模型输出,而不是从零开始,而人工批准仍然是受控质量流程的一部分。
模型集成文档是的。团队可以使用元数据过滤器、语义搜索、嵌入、相似性和异常值发现来管理文档数据,然后标注选定的样本、审查结果并发布受控数据集版本以进行可重复的人工智能开发。
数据集管理文档