中文

这篇论文拥有最聪明的审稿人——利用基于音频-文本Transformer的方法进行奉承检测

声音 2024-06-26 v1 计算与语言 音频与语音处理

摘要

奉承是人类交流的一个重要方面,它通过策略性的赞美和表扬促进社会联系、塑造感知并影响行为,有效利用言语建立融洽关系。因此,其自动检测可以增强人机交互的自然性。为满足这一需求,我们提出了一个包含20小时语音的新型音频文本数据集,并训练机器学习模型用于自动奉承检测。具体而言,我们针对语音模态采用了预训练的AST、Wav2Vec2和Whisper模型,针对文本模态采用了Whisper TTS模型结合RoBERTa文本分类器。随后,我们通过结合文本和音频表示构建了一个多模态分类器。在未见测试数据上的评估显示出有希望的结果,音频仅实验的未加权平均召回率达到82.46%,文本仅实验达到85.97%,而使用多模态方法达到87.16%。

关键词

引用

@article{arxiv.2406.17667,
  title  = {This Paper Had the Smartest Reviewers -- Flattery Detection Utilising an Audio-Textual Transformer-Based Approach},
  author = {Lukas Christ and Shahin Amiriparian and Friederike Hawighorst and Ann-Kathrin Schill and Angelo Boutalikakis and Lorenz Graf-Vlachy and Andreas König and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2406.17667},
  year   = {2024}
}

备注

Interspeech 2024