




为每个产品字段选择连续、不重叠的文本范围。在分配类别时,保留精确的可见原文字符。
在同一 HTML 页面内连接规格名称及其值。添加所需属性,描述字段角色或人工录入的标准化值。

产品页面信息提取标注对模型应从网页提取的可见产品字段添加标签,例如名称、品牌、型号、价格或规格值。Unitlab 将这些标签与上传的 HTML 快照保持关联,用于训练和评估。
为数据集所需的可见字段定义实体类别。常见示例包括产品名称、品牌、型号标识、价格、供货状态、材料、尺寸与其他明确列出的规格。
可以。使用不同类别或预定义的价格角色属性,并检查周围的报价文本。保留实际原文值,不要假设页面上每个金额都描述主产品。
可以。将每个可见名称与值标注为独立文本实体,再在同一 HTML 页面内创建本体定义的关系,记录提取任务所需的关联。
可以,前提是本体包含适当的属性。标注员可录入经过审核的标准化值,同时保留选中的原文。此工作流不会自动推断或标准化产品属性。
HTML 工作流使用已上传的 .html 或 .htm 快照。标注员审核渲染后的已保存内容;该工作流不是实时网站爬虫,也不是会跟随链接并改变页面的浏览器会话。
此方案用于准备和审核人工标注的提取样本,不代表自动爬取、产品匹配或自动字段提取。下游模型可根据训练要求使用这些经过审核的标签。
结合渲染后的上下文检查所选文本,包括附近的标题、报价详情与推荐商品。上下文评论和已配置的审核工作流可将错误位置或有歧义的字段角色退回修正。
HTML 标注支持 JSONL 和 Unitlab 统一导出格式。导出保留受支持的源标识、文本锚点信息、实体标签、属性、关系及数据项属性,用于下游数据集准备。