中文

REALTALK:面向长期对话的21天真实世界数据集

计算与语言 2025-02-20 v1

摘要

长期、开放域对话能力对于旨在回忆过往交互并展现情感智能的聊天机器人至关重要。然而,现有大多数研究依赖于合成的、LLM 生成的数据,留下了关于真实世界对话模式的开放性问题。为填补这一空白,我们引入了 REALTALK,一个包含 21 天真实即时通讯应用对话的语料库,为真实人类交互提供了直接的基准。我们首先进行了数据集分析,重点关注情感智能属性和人格一致性,以理解真实世界对话带来的独特挑战。通过与 LLM 生成的对话进行比较,我们突出了关键差异,包括合成对话通常无法捕捉的多样化情感表达和人格稳定性变化。基于这些发现,我们引入了两项基准任务:(1) 人格模拟,即模型在给定先前对话上下文的情况下代表特定用户继续对话;(2) 记忆探测,即模型回答需要对过去交互具有长期记忆的针对性问题。我们的研究结果显示,模型难以仅从对话历史中模拟用户,而在特定用户聊天数据上进行微调可以改善人格模拟。此外,现有模型在真实世界对话中回忆和利用长期上下文方面面临重大挑战。

关键词

引用

@article{arxiv.2502.13270,
  title  = {REALTALK: A 21-Day Real-World Dataset for Long-Term Conversation},
  author = {Dong-Ho Lee and Adyasha Maharana and Jay Pujara and Xiang Ren and Francesco Barbieri},
  journal= {arXiv preprint arXiv:2502.13270},
  year   = {2025}
}

备注

20 pages, 7 figures