基于多阶段条件的面向情感识别的人类群体合成数据生成
计算与语言
2025-09-16 v2 人工智能
摘要
在情感识别领域,开发高性能模型仍面临数据稀缺的挑战。情感表达本身具有主观性,受个体性格特质、社会文化背景及情境因素的影响,这使得大规模、可推广的数据收集在伦理和实际操作层面都困难重重。为此,我们引入PersonaGen——一种利用大语言模型(LLM)通过多阶段人设驱动生成富有情感色彩文本的新型框架。PersonaGen通过组合人口统计学属性、社会文化背景和详细情境情境,构建分层虚拟人设,再据此引导情感表达生成。我们对生成的合成数据进行全面评估,包括通过聚类和分布指标衡量语义多样性、通过LLM评分评估类人性、通过与真实情感语料库的比较衡量真实性,以及在下游情感分类任务中检验实际用途。实验结果表明,PersonaGen在生成多样、连贯且具辨识度的情感表达方面显著优于基线方法,展示了其作为强大替代方案来增强或取代真实情感数据集的潜力。
引用
@article{arxiv.2507.13380,
title = {Persona-Based Synthetic Data Generation Using Multi-Stage Conditioning with Large Language Models for Emotion Recognition},
author = {Keito Inoshita and Rushia Harada},
journal= {arXiv preprint arXiv:2507.13380},
year = {2025}
}