AuditoryHuM:基于Human-MLLM协作的听觉场景标签生成与聚类
声音
2026-02-24 v1
摘要
音频数据集的手动标注工作量大,且在标签粒度与声学可分离性之间难以取得平衡。我们提出AuditoryHuM,一个 novel 框架,用于利用Human-Multimodal Large Language Model(MLLM)协作方式进行听觉场景标签的无监督发现与聚类。通过利用 MLLMs(Gemma 和 Qwen)生成与音频数据情境相关的标签。为确保标签质量并缓解幻觉现象,我们采用零样本学习技术(Human-CLAP)来量化生成文本标签与原始音频内容之间的对齐程度。随后,对最不匹配的对进行策略性的人类介入,以进行细化。所发现的标签利用包含惩罚参数的调整轮廓得分(adjusted silhouette score)进行组织,平衡聚类内凝聚力和主题粒度。该方法在三个多样化的听觉场景数据集(ADVANCE、AHEAD-DS 和 TAU 2019)上进行评估,AuditoryHuM 提供了一个可扩展、低成本的解决方案,用于创建标准化的分类学。该解决方案促进了轻量级场景识别模型的训练,这些模型可部署到听力器和智能家居助手等边缘设备上。项目页面和代码:https://github.com/Australian-Future-Hearing-Initiative
引用
@article{arxiv.2602.19409,
title = {AuditoryHuM: Auditory Scene Label Generation and Clustering using Human-MLLM Collaboration},
author = {Henry Zhong and Jörg M. Buchholz and Julian Maclaren and Simon Carlile and Richard F. Lyon},
journal= {arXiv preprint arXiv:2602.19409},
year = {2026}
}