中文

面向有效作者归属:融入类别增量学习

信息检索 2024-08-20 v1 数字图书馆

摘要

作者归属(AA)是将一篇未识别文档归属到预定义已知候选作者群体的过程,每位候选作者拥有多个样本。作者归属的本质要求系统能够容纳不断涌现的新作者,因为每位个体都必须被视为独特的。这种独特性可归因于多种因素,包括其风格偏好、专业领域、性别、文化背景以及其他影响其写作的个人特征。这些多样的属性共同构成了每位作者的独特性,使得作者归属系统必须识别并考虑这些差异。然而,当前的作者归属基准普遍忽视了这种独特性,将问题框定为封闭世界分类,假设系统生命周期内作者数量固定,且忽视了新作者的纳入。这一疏忽导致大多数现有方法在作者归属的真实应用场景中失效,因为在真实场景中持续学习至关重要。这些低效性表现为当前模型要么抗拒学习新作者,要么遭遇灾难性遗忘——即新数据的引入导致模型丢失先前习得的知识。为解决这些低效性,本文重新将作者归属定义为类别增量学习(CIL),即在初始训练阶段之后逐步引入新作者,使系统能够自适应并持续学习。为实现这一目标,本文简要审视了其他领域中后续提出的类别增量学习方法。此外,本文采用了多种知名的类别增量学习方法,并审视了它们在作者归属背景下的优势与劣势。同时,本文概述了推进类别增量学习作者归属系统的潜在未来方向。因此,本文可作为作者归属系统从封闭世界模型向通过类别增量学习范式进行持续学习演进的起点。

关键词

引用

@article{arxiv.2408.08900,
  title  = {Towards Effective Authorship Attribution: Integrating Class-Incremental Learning},
  author = {Mostafa Rahgouy and Hamed Babaei Giglou and Mehnaz Tabassum and Dongji Feng and Amit Das and Taher Rahgooy and Gerry Dozier and Cheryl D. Seals},
  journal= {arXiv preprint arXiv:2408.08900},
  year   = {2024}
}

备注

Submitted to IEEE CogMI 2024 Conference