命名实体识别训练数据

标注文本中的人物、组织、产品、地点和领域术语。通过精确的文本片段、结构化属性及经审核人员验证的标注,构建 NER 数据集。
Named Entity Recognition example with source-data annotations and contextual photographs.

将语言转化为已标注实体

为商业文本、产品用语和专业术语创建一致的标注样本。
Text with precise person, organization, location, and domain entity spans.

商业实体

在人物、组织和地点出现的句子中进行标记,保留训练实体识别模型所需的上下文。
Text with labeled product and issue mentions.

产品与服务提及

识别客户表述中的产品名称和服务术语,让模型学习业务实际使用的词汇。
Text with quantity, item, and date annotations.

日期与数量

使用为提取任务定义的类别,精确标注日期、金额和数量的文本片段。
Scientific text with biomolecule and sample-type entity labels.

专业术语

根据数据集词汇定义实体类别,标注科学、法律或特定行业术语。

AI 团队为何选择 Unitlab

将文本标注、共用本体、专家审核和数据集交付整合到统一工作流,让团队专注于准备有价值的训练数据。
15X
加快文本标注
60%
释放 AI 工程师时间
5X
降低 AI 开发成本

命名实体识别的标注类型

将精确的文本片段与描述语言任务的结构化关系和属性结合。
Text with precise person, organization, location, and domain entity spans.

实体文本片段

精确选择组成实体的字符并指定类别,同时保留原始文本上下文。

实体属性

使用本体中定义的选项,添加实体子类型或标注确定性等结构化属性。

Organization entity with a structured sector property.

命名实体识别常见问题

什么是命名实体识别标注?

NER 标注用于标记文本中的命名实体或领域实体,让模型学习哪些字符指代人物、组织、地点、产品或其他已定义概念。

能否自定义实体类别?

可以。为任务相关实体创建类别,包括专业产品、科学或商业术语,并通过属性记录更多上下文。

实体标签可以有多精确?

标注人员选择具体的文本片段,而不只是标记整句。选中的字符和实体类别会随标注一同保存。

同一短语在不同上下文中是否需要不同标签?

是的。本体和指南定义了上下文如何决定类别。实体提及存在歧义时,审核人员可以查看周围句子。

实体标注能否包含关系?

可以。支持的实体关系可连接文本中已标注的实体提及,为实体识别数据集补充信息提取任务所需的关联。

团队应如何处理不一致的文本片段边界?

在标注指南中定义示例,在审核期间讨论困难案例,并在创建发布版本前对整个数据集应用相同的边界规则。

可以使用哪些文本输入?

原生语言标注使用纯文本文件。围绕团队需要标注的文本和任务,定义实体类别、关系及数据项属性。

团队如何审核语言标签?

将已标注文本送入审核,结合上下文处理评论和修正,并在发布数据集前使用已配置的共识机制或已批准的基准检查一致性。

能否导出已标注文本用于模型开发?

可以。文本支持 JSONL 和 Unitlab 统一导出格式。选择能够保留训练流水线所需实体、关系和属性的导出格式。