中文

通过去除隐式反馈中的虚假兴趣来提高个性化标题生成

计算与语言 2025-08-15 v2 人工智能

摘要

准确的个性化标题生成依赖于精准捕捉用户历史行为中的兴趣。然而,现有方法忽略了整个历史点击流中个性化无关的点击噪声,这可能导致生成偏离真实用户偏好的幻觉标题。本文通过在用户维度和新闻维度进行严格分析,揭示了点击噪声对个性化生成质量的不利影响。基于这些洞察,我们提出了一种新的个性化标题生成框架,通过去除隐式反馈中的虚假兴趣(PHG-DIF)。PHG-DIF 首先采用双阶段过滤有效移除由短停留时间和异常点击突发事件识别的点击流噪声,然后利用多级时序融合动态建模用户不断演变和多面的兴趣,以实现精准的个人化轮廓。此外,我们发布了一个新的基准数据集 DT-PENS,包含 1,000 位精心挑选的用户点击行为,以及近 10,000 条带有历史停留时间标注的个性化标题。大量实验表明,PHG-DIF 在显著缓解点击噪声的负面影响方面取得显著效果,显著提升了标题质量,在 DT-PENS 上实现了最先进(SOTA)结果。我们的框架实现代码和数据集均已公开于 https://github.com/liukejin-up/PHG-DIF。

关键词

引用

@article{arxiv.2508.07178,
  title  = {Improved Personalized Headline Generation via Denoising Fake Interests from Implicit Feedback},
  author = {Kejin Liu and Junhong Lian and Xiang Ao and Ningtao Wang and Xing Fu and Yu Cheng and Weiqiang Wang and Xinyu Liu},
  journal= {arXiv preprint arXiv:2508.07178},
  year   = {2025}
}

备注

Accepted by the 34th ACM International Conference on Information and Knowledge Management (CIKM '25), Full Research Papers track