面向网页内容提取的 HTML 标注

为内容提取模型明确区分页面正文、导航与推广文本。在渲染后的 HTML 快照中标注原文片段和文章元数据,并进行人工审核。
Editorial HTML collage with main content and metadata labels

区分有效内容与页面周边文本

保留源页面上下文,为文章、指南和编辑类网页的内容提取构建清晰样本。
Article main-body text selected within a rendered HTML source

正文文本

标记属于文章或指南的可见段落。使用一致的边界,使所选文本包含目标内容,并排除相邻导航或推广内容。
Main content and excluded navigation text shown as separate source spans

模板化文本排除

将可见导航、订阅提示及其他需排除的文本与正文分别标注。对于存在歧义的页面区块,在项目指南中明确纳入规则。
Article title author and publication date as separate HTML entities

文章元数据

在渲染后的页面中识别标题、作者与发布日期。将文章自身的元数据与相关文章卡片或页脚文本区分开来。
A corrected content span includes the complete sentence

内容边界审核

对照原始页面审核所选内容的起止位置。在批准样本前,修正被截断的句子、误纳入的推广文本或错误的文本位置。

AI 团队为何选择 Unitlab

为训练数据团队将 HTML 源页面上下文、共享本体、人工审核与数据集交付纳入统一工作流。
15X
加快 HTML 标注
60%
释放 AI 工程师的时间
5X
降低 AI 开发成本

网页内容提取的标注类型

将不重叠的内容片段与描述源页面及任务的页面级属性结合起来。
Precise non-overlapping text-span labels on an editorial webpage

内容与元数据片段

每次为正文或元数据标注一个连续的可见文本范围。保持标签不重叠,并根据项目边界规则区分相邻文本的角色。

页面级属性

使用页面类型、语言等属性对整个 HTML 数据项分类,同时保留其内部文本标注。这些属性值描述已保存的源页面。

HTML page classification alongside internal text annotations

网页内容提取常见问题

什么是网页内容提取标注?

网页内容提取标注明确提取系统应保留的页面文本及应排除的周边文本。经过审核的正文、元数据与模板化文本标签帮助团队为网页内容提取器构建训练和评估数据。

为何标注渲染后的 HTML,而非纯文本?

渲染后的快照保留标题、分栏、文章区块与附近推荐内容等上下文线索。标注员仍然标注可见文本片段,而页面呈现方式帮助判断哪些文本属于提取目标。

哪些内容属于正文或模板化文本?

项目指南为各类源页面定义规则。文章段落通常属于正文,导航或订阅提示通常不属于正文。应明确评论、图注与相关链接的处理方式,使标注员采用相同规则。

可以同时标注整段正文与其中嵌套的字段吗?

HTML 实体范围必须连续且不重叠。请选择避免对相同字符重复标注的片段方案。使用数据项属性进行整页分类,并将内部内容与元数据片段分别标注。

可以标注文章标题、作者和日期吗?

可以。为各字段创建不同的实体类别,并选择可见原文。审核周围上下文,避免将推荐文章的作者或日期误认为当前文章的元数据。

可以将页面分类为文章或指南吗?

可以。配置页面类型或其他整页类别的数据项属性。这些属性描述完整的已保存 HTML 数据项,实体标注则标记其中的独立文本范围。

Unitlab 会自动获取或清理实时网站吗?

此方案标注已上传的 .html 或 .htm 快照,不会爬取实时网页或自动移除模板化文本。经过审核的标注为下游提取或清理系统提供可用样本。

团队应如何审核内容边界?

在渲染后的页面中检查所选文本,核对句子完整性与相邻区块,并对照指南处理歧义案例。通过上下文评论、审核与返工,修正遗漏内容或误纳入的模板化文本。

可以导出标签用于内容提取评估吗?

可以。HTML 支持 JSONL 和 Unitlab 统一导出格式,包含受支持的源标识、文本锚点、实体标签与属性。将已审核输出适配到您自己的内容提取流程所要求的输入与评估格式。