




제품 필드마다 연속적이고 겹치지 않는 텍스트 범위를 선택합니다. 보이는 원본 문자를 정확히 보존하면서 클래스를 지정합니다.
동일한 HTML 페이지 안에서 사양 이름과 값을 연결합니다. 필드 역할이나 사람이 입력한 정규화 값을 설명하는 필수 속성을 추가합니다.

제품명, 브랜드, 모델, 가격, 사양 값 등 모델이 웹페이지에서 추출해야 할 가시 필드를 라벨링하는 작업입니다. Unitlab은 학습과 평가를 위해 라벨을 업로드한 HTML 스냅샷에 연결해 유지합니다.
데이터셋에 필요한 가시 필드에 개체 클래스를 정의합니다. 제품명, 브랜드, 모델 식별자, 가격, 재고 상태, 소재, 치수, 그 밖에 명시된 사양이 대표적인 예입니다.
네. 서로 다른 클래스나 정의된 가격 역할 속성을 사용하고 주변 판매 조건 텍스트를 확인합니다. 페이지의 모든 금액이 주 제품을 설명한다고 가정하지 않고 실제 원본 값을 보존합니다.
네. 보이는 이름과 값을 각각 별도 텍스트 개체로 어노테이션한 다음 동일한 HTML 페이지 안에서 온톨로지에 정의된 관계를 만듭니다. 이 관계는 추출 작업에 필요한 연결을 기록합니다.
온톨로지에 적절한 속성이 있는 경우 가능합니다. 어노테이터는 선택한 원문을 유지하면서 검토된 정규화 값을 입력할 수 있습니다. 이 워크플로는 제품 속성을 자동으로 추론하거나 정규화하지 않습니다.
HTML 워크플로는 업로드한 .html 또는 .htm 스냅샷을 사용합니다. 어노테이터는 렌더링된 저장 콘텐츠를 검토하며, 링크를 따라 페이지를 변경하는 실시간 크롤러나 브라우저 세션은 사용하지 않습니다.
이 솔루션은 사람이 라벨링한 추출 예시를 준비하고 검토합니다. 자동 크롤링, 제품 매칭, 자동 필드 추출을 의미하지 않습니다. 후속 모델은 학습 요구 사항에 맞춰 검토된 라벨을 활용할 수 있습니다.
주변 제목, 판매 조건, 추천 상품을 포함한 렌더링 맥락에서 선택된 텍스트를 검토합니다. 맥락을 담은 댓글과 구성된 검토 워크플로로 잘못된 위치나 모호한 필드 역할을 수정하도록 돌려보냅니다.
HTML 어노테이션은 JSONL과 Unitlab 통합 내보내기 형식을 지원합니다. 내보내기는 후속 데이터셋 준비를 위해 지원되는 원본 식별 정보, 텍스트 앵커 정보, 개체 라벨, 속성, 관계, 항목 속성을 보존합니다.