超越离散人格:通过日记密集对话的人格建模
计算与语言
2024-12-17 v1 人工智能
摘要
大型语言模型(LLMs)显著提升了个性化对话能力。然而,现有数据集如Persona Chat、Synthetic Persona Chat和Blended Skill Talk依赖于静态、预定义的人格。这一方法常常导致对话未能捕捉人类人格的流动和演变性质。为克服这些限制,我们引入了一个包含约400,000个对话的新型数据集,以及一个用于使用来自Reddit的长式日记条目生成个性化对话的框架。我们的做法对每个作者的日记条目进行聚类,并通过选择最具代表性的聚类来筛选它们,确保保留的条目最能反映作者的人格。我们进一步通过捕捉大五人格特征——开放性、尽责性、外向性、合同性和神经质——确保对话真实反映个体的人格。使用Llama 3 70B生成以这些日记条目为基础的高质量、富有人格特征的对话。对模型进行微调后,在捕捉人格特征方面平均提升了11%,在生成更连贯和以人格为导向的对话方面超越了现有方法。
引用
@article{arxiv.2412.11250,
title = {Beyond Discrete Personas: Personality Modeling Through Journal Intensive Conversations},
author = {Sayantan Pal and Souvik Das and Rohini K. Srihari},
journal= {arXiv preprint arXiv:2412.11250},
year = {2024}
}
备注
Accepted in COLING 2025