中文

大语言模型下的后 ASR 情感识别中的上下文与系统融合

计算与语言 2024-10-07 v1 音频与语音处理

摘要

大型语言模型(LLMs)在建模语音和文本方面发挥着越来越重要的作用。为探索在后 ASR 情感预测中如何最好地利用上下文和多个系统输出,我们研究了 LLM 在最近的一个任务(称为 GenSEC)中的提示方法。我们的技术包括 ASR 转录排序、可变对话上下文以及系统输出融合。我们显示,对话上下文的收益会逐渐下降,而用于选择预测转录的度量标准至关重要。最后,我们的最佳提交方案相对于提供的基线提高了 20% 的绝对准确率。

关键词

引用

@article{arxiv.2410.03312,
  title  = {Context and System Fusion in Post-ASR Emotion Recognition with Large Language Models},
  author = {Pavel Stepachev and Pinzhen Chen and Barry Haddow},
  journal= {arXiv preprint arXiv:2410.03312},
  year   = {2024}
}