中文

PersonaTAB:基于文本、语音和行为线索预测语音对话中人格特征

声音 2025-05-21 v1 计算与语言 音频与语音处理

摘要

尽管神经语音对话系统在显著进步,但具备人格感知能力的对话智能体——能够根据人格调整行为——仍未得到充分探索,这主要归因于语音数据集中缺乏人格标注。我们提出了一条流水线,用于预处理原始音频录音,创建带有时间戳、响应类型及情感/情绪标签的对话数据集。我们采用自动语音识别(ASR)系统提取转录文本和时间戳,然后生成对话级别的标注。利用这些标注,我们设计了一个系统,利用大型语言模型预测对话中的人格特征。我们邀请了人类评估者以识别对话特征并分配人格标签。我们的分析表明,所提出的系统在与人类判断的对齐度方面优于现有方法。

关键词

引用

@article{arxiv.2505.14356,
  title  = {PersonaTAB: Predicting Personality Traits using Textual, Acoustic, and Behavioral Cues in Fully-Duplex Speech Dialogs},
  author = {Sho Inoue and Shai Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2505.14356},
  year   = {2025}
}

备注

This is accepted to Interspeech 2025; Added an extra page for supplementary figures; Project page: https://github.com/shinshoji01/Personality-Prediction-for-Conversation-Agents