




본문이나 메타데이터의 연속된 가시 텍스트 범위를 하나씩 라벨링합니다. 라벨은 겹치지 않게 유지하고 프로젝트의 경계 규칙으로 인접 텍스트의 역할을 구분합니다.
내부 텍스트 어노테이션을 유지하면서 페이지 유형, 언어 등의 속성으로 전체 HTML 항목을 분류합니다. 이러한 값은 저장된 원본 페이지를 설명합니다.

추출 시스템이 유지해야 할 페이지 텍스트와 제외해야 할 주변 텍스트를 식별하는 작업입니다. 검토된 본문, 메타데이터, 상용구 라벨은 웹 콘텐츠 추출기의 학습 및 평가 데이터 구축을 지원합니다.
렌더링된 스냅샷은 제목, 열 구성, 기사 섹션, 인접 추천 콘텐츠 같은 맥락 단서를 보존합니다. 어노테이터는 가시 텍스트 구간을 라벨링하면서 페이지의 표시 방식을 참고하여 추출 대상에 속하는 텍스트를 판단합니다.
프로젝트 지침에서 원본 유형별 규칙을 정의합니다. 기사 문단은 보통 본문에 포함되고 탐색 메뉴나 구독 안내는 대개 제외됩니다. 댓글, 캡션, 관련 링크의 처리 기준도 명시하여 동일한 정책을 적용합니다.
HTML 개체 범위는 연속적이며 겹칠 수 없습니다. 같은 문자를 두 번 라벨링하지 않는 구간 체계를 선택하세요. 전체 페이지 분류에는 항목 속성을 사용하고 내부 콘텐츠와 메타데이터 구간은 별도로 유지합니다.
네. 필드별로 개체 클래스를 만들고 보이는 원문 텍스트를 선택합니다. 추천 콘텐츠의 작성자나 날짜를 현재 기사의 메타데이터로 오인하지 않도록 주변 맥락을 검토합니다.
네. 페이지 유형이나 다른 전체 페이지 범주에 대한 항목 속성을 구성합니다. 속성은 저장된 전체 HTML 항목을 설명하고 개체 어노테이션은 내부의 개별 텍스트 범위를 라벨링합니다.
이 솔루션은 업로드한 .html 또는 .htm 스냅샷을 라벨링합니다. 실시간 웹 크롤링이나 상용구 자동 제거는 수행하지 않습니다. 검토된 어노테이션은 후속 추출 또는 정제 시스템이 활용할 예시를 제공합니다.
렌더링된 페이지에서 선택 텍스트와 문장 완결성, 인접 섹션을 확인하고 모호한 사례를 지침과 비교합니다. 맥락을 담은 댓글, 검토, 재작업으로 누락된 콘텐츠나 포함된 상용구를 수정합니다.
네. HTML은 지원되는 원본 식별 정보, 텍스트 앵커, 개체 라벨, 속성을 포함하는 JSONL과 Unitlab 통합 내보내기 형식을 지원합니다. 검토된 출력을 자체 콘텐츠 추출 파이프라인의 입력 및 평가 형식에 맞춰 적용하세요.