用于提升个性化文本摘要器的动态用户偏好数据的多样性增强
计算与语言
2025-10-14 v1 机器学习
摘要
文档摘要使能够高效提取用户相关内容,但本质上受到个体主观性影响,导致识别多元文档中的主观显著信息具有挑战性。这凸显了需要进行个性化摘要的必要性。然而,针对个性化摘要的模型训练至今具有挑战,尤其是由于包含用户偏好历史(即点击-跳过轨迹)和预期(金标准)摘要的多样化训练数据稀缺。MS/CAS PENS 数据集是一宝贵资源,但仅包含偏好历史而无目标摘要,阻止端到端监督学习,其有限的主题转换多样性进一步限制了泛化。为此,我们提出 ,一种基于跨轨迹随机化和摘要内容扰动的数据增强技术,显著提升了四个最先进基准 (SOTA) 用户编码器在个性化摘要框架中的准确性(最佳结果: 相对于 AUC)。我们选取其中两个 SOTA 摘要器框架作为基准,观察到当增强了其相应改进的用户编码器后,它们在个性化方面始终表现出提升(平均提升: 相对于 PSE-SU4 指标)。作为对由 \peraugy 诱导数据集多样性在增强数据集中作用的事后分析,我们引入三个数据集多样性指标——、 和 ——用于量化诱导的多样性。我们发现 和 在 PerAugy 生成的数据集上与用户编码器性能在所有准确性指标上强烈相关,表明数据集的增加多样性是性能提升的关键因素。
引用
@article{arxiv.2510.10082,
title = {Diversity Augmentation of Dynamic User Preference Data for Boosting Personalized Text Summarizers},
author = {Parthiv Chatterjee and Shivam Sonawane and Amey Hengle and Aditya Tanna and Sourish Dasgupta and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2510.10082},
year = {2025}
}