一个提示,多种声音:在基于 LLM 的均衡器中对听众偏好差异进行建模
声音
2026-05-13 v2 人工智能
摘要
传统的音频均衡是一个静态过程,需要手动进行繁琐的调整以适应不断变化的收听环境(例如情绪、位置或社交场合)。在本文中,我们引入了一种基于大语言模型(LLM)的替代方案,将自然语言文本提示映射到均衡器设置。这实现了一种对话式的音响系统控制方法。通过利用在受控收听实验中收集的数据,我们的模型利用上下文学习和参数高效微调技术,可靠地与人群偏好的均衡器设置对齐。我们的评估方法利用了捕捉用户多样化偏好的分布指标,表明在分布对齐方面,相较于随机采样和静态预设基线取得了统计学上的显著改善。这些结果表明,LLM 可以充当“人工均衡器”,有助于开发更易于使用、具备情境感知能力且达到专家水平的音频调优方法。
引用
@article{arxiv.2601.09448,
title = {One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization},
author = {Ioannis Stylianou and Jon Francombe and Pablo Martinez-Nuevo and Sven Ewan Shepstone and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2601.09448},
year = {2026}
}
备注
13 pages, 15 figures, 2 tables, IEEE JSTSP submission