ARC-NLP 在 PAN 2023 上的工作:面向触发内容检测的分层长文本分类
计算与语言
2023-07-28 v1 社会与信息网络
摘要
同人小说是一种设定在既有虚构宇宙中的流行创意写作形式,已在线上获得大量追随者。然而,保障参与者的身心健康与安全已成为该社群的一项关键关切。触发内容(可能引发读者情绪困扰或创伤的材料)的检测构成重大挑战。在本文中,我们描述了在 PAN CLEF 2023 触发内容检测共享任务中的方法,该任务旨在检测给定同人小说文档中的多种触发内容。为此,我们构建了一个利用基于 Transformer 的语言模型进行递归的分层模型。在我们的方法中,首先将长文档切分为较小片段,并用其微调一个 Transformer 模型。随后,从微调后的 Transformer 模型中提取特征嵌入,作为多标签设定下多个 LSTM 模型进行触发检测的训练输入。我们的模型在验证集上取得了 0.372 的宏 F1 分数与 0.736 的微 F1 分数,均高于 PAN CLEF 2023 公布的基线结果。
引用
@article{arxiv.2307.14912,
title = {ARC-NLP at PAN 2023: Hierarchical Long Text Classification for Trigger Detection},
author = {Umitcan Sahin and Izzet Emre Kucukkaya and Cagri Toraman},
journal= {arXiv preprint arXiv:2307.14912},
year = {2023}
}
备注
Accepted by PAN at CLEF 2023