




有明确边界的时间区间标识已定义声音事件发生的位置。类别与属性值描述可听证据,同时保留原始录音。
边界框标识图像或视频帧中的可见声源。结合对应的音频证据和已配置属性审核声源框。

这项工作准备能够识别声音事件及其可见声源的示例。标注人员标记声音区间以及相关视觉媒体中的物体,再审核两者的对应关系。
声音事件检测识别听到了什么以及何时发生。视听定位还识别场景中的可见声源,例如发出铃声的铃。
受支持的音频和视频文件可组成多模态案例。已配置的布局让相关源数据保持可见,标注人员可使用各查看器的原生工具。
团队可在相关标注上使用匹配的已配置声源标识符或事件属性。标注人员通过检查记录建立对应关系;文件分组不会推断某个声音事件属于哪个物体。
文件分组根据已配置的命名规则与分组键组织相关输入。在标注声源前,团队必须核实记录的时间及对应关系。
为画面外或不确定的声源制定项目规则,并使用已配置属性记录该情况。只有当画面提供物体存在的证据时,才应创建可见声源框。
标注人员可为本体要求的各类事件创建独立区间。当声音重叠或声源不明确时,清晰定义与审核尤其重要。
此工作流准备人工标注示例和经过审核的声源对应关系。这些标注支持下游模型训练与评估,并不表示 Unitlab 会自动定位声源。
审核人员对照相关记录检查声音边界、可见声源区域和已配置标识符。未通过的工作可退回修正,再重新验收。