PersonaTAB:基于文本、语音和行为线索预测语音对话中人格特征
声音
2025-05-21 v1 计算与语言
音频与语音处理
摘要
尽管神经语音对话系统在显著进步,但具备人格感知能力的对话智能体——能够根据人格调整行为——仍未得到充分探索,这主要归因于语音数据集中缺乏人格标注。我们提出了一条流水线,用于预处理原始音频录音,创建带有时间戳、响应类型及情感/情绪标签的对话数据集。我们采用自动语音识别(ASR)系统提取转录文本和时间戳,然后生成对话级别的标注。利用这些标注,我们设计了一个系统,利用大型语言模型预测对话中的人格特征。我们邀请了人类评估者以识别对话特征并分配人格标签。我们的分析表明,所提出的系统在与人类判断的对齐度方面优于现有方法。
引用
@article{arxiv.2505.14356,
title = {PersonaTAB: Predicting Personality Traits using Textual, Acoustic, and Behavioral Cues in Fully-Duplex Speech Dialogs},
author = {Sho Inoue and Shai Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2505.14356},
year = {2025}
}
备注
This is accepted to Interspeech 2025; Added an extra page for supplementary figures; Project page: https://github.com/shinshoji01/Personality-Prediction-for-Conversation-Agents