中文

AudioLog:基于 LLM 与混合词元-语义对比学习的长音频记录系统

音频与语音处理 2024-01-05 v2

摘要

以往自动音频描述研究难以准确捕捉长音频序列中声学场景与事件的完整时间细节。本文提出 AudioLog,一种由大语言模型(LLM)驱动、具有混合词元-语义对比学习的音频记录系统。具体而言,我们提出通过引入混合声学表征间的对比学习来微调预训练的分层词元-语义音频 Transformer。随后利用 LLM 生成音频记录,总结声学环境的文本描述。最后,我们在两个同时具有场景与事件标注的数据集上评估 AudioLog 系统。实验表明,所提系统在声学场景分类与声音事件检测上取得优异性能,超越该领域现有方法。对 LLM 提示的进一步分析显示,AudioLog 能有效总结长音频序列。据我们所知,该方法是首个利用 LLM 总结长音频序列的尝试。

关键词

引用

@article{arxiv.2311.12371,
  title  = {AudioLog: LLMs-Powered Long Audio Logging with Hybrid Token-Semantic Contrastive Learning},
  author = {Jisheng Bai and Han Yin and Mou Wang and Dongyuan Shi and Woon-Seng Gan and Jianfeng Chen and Susanto Rahardja},
  journal= {arXiv preprint arXiv:2311.12371},
  year   = {2024}
}