基于声音情感质量网络和大语言模型的声景描述
音频与语音处理
2025-08-26 v3 声音
信号处理
摘要
我们生活在丰富多样的声学世界中,这种世界以声景形式被个体或社群所体验。计算声景分析通过检测和分类声音事件来分离声景,关注声音的客观属性,如其类别和时间特征,忽略其对人们产生的情感影响。为填补这一空白,我们提出情感声景描述(ASSC)任务,使自动化声景分析成为可能,从而避免传统方法中耗时的主观评估和调查。通过声景描述,可为声景生成上下文感知的描述,同时捕获声景(ASs)、音频事件(AEs)信息及其对应的人类情感质量(AQs)。为此,我们提出一种自动声景描述器(SoundSCaper)系统,由声音情感质量网络(SoundAQnet)和大语言模型(LLM)组成。SoundAQnet 同时建模声景(ASs)、音频事件(AEs)和感知情感质量(AQs)的多尺度信息,而 LLM 通过解析由 SoundAQnet 捕获的信息来生成声景描述。SoundSCaper 由 32 人组成的两组评审进行评估。在专家评估中,SoundSCaper 生成的描述在评估数据集 D1 和外部混合数据集 D2 上的平均得分略低于两个声景专家,但未达到统计显著性。在普通人评估中,SoundSCaper 在多个指标上优于声景专家。除人类评估外,SoundSCaper 在多个基于自然语言处理的指标上优于其他带或不带 LLM 的自动音频描述系统。总体而言,SoundSCaper 在人类主观评估和各种客观描述指标上表现良好,生成的描述与由声景专家标注的相当。
引用
@article{arxiv.2406.05914,
title = {Soundscape Captioning using Sound Affective Quality Network and Large Language Model},
author = {Yuanbo Hou and Qiaoqiao Ren and Andrew Mitchell and Wenwu Wang and Jian Kang and Tony Belpaeme and Dick Botteldooren},
journal= {arXiv preprint arXiv:2406.05914},
year = {2025}
}
备注
IEEE Transactions on Multimedia, Code: https://github.com/Yuanbo2020/SoundSCaper