基于 Transformer 和混合深度学习模型的机器生成文本检测
计算与语言
2024-05-29 v1
摘要
本文描述了 UniBuc - NLP 团队在应对 SemEval 2024 Task 8:多生成器、多域、多语言黑箱机器生成文本检测中所采用的方法。我们探索了基于 Transformer 的模型和混合深度学习架构。对于子任务 B,我们的基于 Transformer 的模型以准确率达到 \textbf{86.95\%} 在 77 支队伍中获得 \textbf{第二名},表明该架构适用于该任务。然而,我们的模型在子任务 A 中出现了过拟合问题,可能通过减少微调和增加最大序列长度来改善。对于子任务 C(标记级分类),我们的混合模型在训练期间出现过拟合,限制了其检测人类文本与机器生成文本之间转换的能力。
引用
@article{arxiv.2405.17964,
title = {Transformer and Hybrid Deep Learning Based Models for Machine-Generated Text Detection},
author = {Teodor-George Marchitan and Claudiu Creanga and Liviu P. Dinu},
journal= {arXiv preprint arXiv:2405.17964},
year = {2024}
}