语音生成型大型音频语言模型中的神经元级情感控制
计算与语言
2026-03-19 v1 音频与语音处理
摘要
大型音频语言模型(LALMs)能够生成具有表现力的语音,但可靠的情感控制仍然尚未实现:转换往往未达到目标情绪,或通过拒绝、幻觉或改写来降低语言保真度。我们在已知的第一项研究中探讨了语音生成型LALMs的情感控制的神经元级研究,展示了紧凑的情感敏感神经元(ESNs)在训练后可以在推理时进行情感干预。ESNs通过成功过滤的激活聚合识别,同时强制实现情感和内容保留。在三个LALMs(Qwen2.5-Omni-7B、MiniCPM-o 4.5、Kimi-Audio)上,ESN干预产生情感特定的提升,适用于未出现的说话人,并得到自动和人类评估的支持。可控性取决于选择器设计、掩码稀疏性、过滤和干预强度。我们的结果为语音生成的训练-free 情感控制建立了机制框架。
引用
@article{arxiv.2603.17231,
title = {Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models},
author = {Xiutian Zhao and Ismail Rasim Ulgen and Philipp Koehn and Björn Schuller and Berrak Sisman},
journal= {arXiv preprint arXiv:2603.17231},
year = {2026}
}
备注
11 pages, 10 figures