面向科学论文中 AI 生成片段的多头跨度检测器
计算与语言
2024-11-19 v1
摘要
本文描述了一个系统,旨在区分第四届科学文档处理研讨会举办的 DAGPap24 竞赛中 AI 生成与人工撰写的科学文本片段。在该竞赛中,任务是在科学领域文档中寻找人工生成的标记级文本片段。我们的工作专注于采用双头的多任务学习架构。该方法的适用性由任务的特殊性所证明,即类别跨度在数百字符上连续。我们考虑了不同的编码器变体以获取序列中每个标记的状态向量,以及将片段拆分为标记以进一步输入基于 Transformer 的编码器的变体。与基线解决方案相比,该方法在开发集上实现了 9% 的质量提升(平均宏 F1 得分从 0.86 提升至 0.95),并在竞赛数据集的封闭测试部分获得了 0.96 的得分。
引用
@article{arxiv.2411.07343,
title = {Multi-head Span-based Detector for AI-generated Fragments in Scientific Papers},
author = {German Gritsai and Ildar Khabutdinov and Andrey Grabovoy},
journal= {arXiv preprint arXiv:2411.07343},
year = {2024}
}