SemEval-2024任务8中的TM-TREK:面向人机混合文本的基于LLM的自动边界检测
计算与语言
2024-04-02 v1
摘要
随着大语言模型(LLM)生成文本的日益普及,为了防止LLM的滥用(如传播误导信息和学术不端),区分LLM生成文本和人类撰写文本引起了越来越多的关注。以往的研究主要集中在将文本分类为完全由人类撰写或完全由LLM生成,忽视了检测同时包含两类内容的混合文本。本文探讨了LLM识别人类撰写和机器生成混合文本边界的能力。我们通过将此任务转化为词元分类问题来处理,并将标签转折点视为边界。值得注意的是,我们的LLM集成模型在SemEval'24竞赛任务8的“人机混合文本检测”子任务中获得第一名。此外,我们还研究了影响LLM在混合文本中检测边界能力的因素,包括在LLM之上引入额外层、分割损失的组合以及预训练的影响。我们的发现旨在为该领域的未来研究提供有价值的见解。
引用
@article{arxiv.2404.00899,
title = {TM-TREK at SemEval-2024 Task 8: Towards LLM-Based Automatic Boundary Detection for Human-Machine Mixed Text},
author = {Xiaoyan Qu and Xiangfeng Meng},
journal= {arXiv preprint arXiv:2404.00899},
year = {2024}
}
备注
1st place at SemEval-2024 Task 8, Subtask C, to appear in SemEval-2024 proceedings