基于人格信息引导的跨语言注意力蒸馏与生成式数据增强
摘要
尽管人格识别领域已有大量工作,但缺乏多语言数据集 remains 一个未解决的挑战。为此,我们提出了 ADAM(Cross-Lingual Attention Distillation with Personality-Guided Generative Augmentation for Multilingual Personality Recognition,跨语言注意力蒸馏与人格引导生成式数据增强用于多语言人格识别),一种旨�推进多语言人格识别的前沿方法。我们的方法利用现有的英文人格数据集作为主要来源,借助大语言模型(LLM)进行翻译以增强数据,并通过人格信息引导的生成式数据增强(PIGA)在日语、中文、马来语和法语等多种语言中生成高质量训练数据。我们对这些数据增强技术的有效性进行了 thorough analysis。基于这些进展,ADAM 集成了跨语言注意力蒸馏(CLAD),用于训练一种能够跨语言理解和识别人格特征的模型,弥合语言和文化在人格分析中的差距。本研究对所提数据增强方法进行了 thorough 评估,包含对识别性能的消融研究,以确保公平比较和稳健的验证。总体而言,借助 PIGA 数据增强,结果表明 CLAD 在所有语言和人格特征上均显著优于标准交叉熵损失,平均 BA 分数分别在 Essays 数据集上提升 0.0573(达到 0.6332),在 Kaggle 数据集上提升 0.0968(达到 0.7448)。CLAD 训练的模型也展现出强大的泛化能力,达到当前领先编码器模型的基准性能。模型权重、数据集和算法仓库可在 https://research.jingjietan.com/?q=ADAM 查阅。
引用
@article{arxiv.2604.08851,
title = {Cross-Lingual Attention Distillation with Personality-Informed Generative Augmentation for Multilingual Personality Recognition},
author = {Jing Jie Tan and Ban-Hoe Kwan and Danny Wee-Kiat Ng and Yan-Chai Hum and Noriyuki Kawarazaki and Kosuke Takano},
journal= {arXiv preprint arXiv:2604.08851},
year = {2026}
}
备注
IEEE Transactions on Cognitive and Developmental Systems (2026)