UPB 在 IberLEF-2023 AuTexTification 的任务:使用 Transformer 集成检测机器生成文本
计算与语言
2023-08-04 v1
摘要
本文描述了 UPB 团队提交给作为 IberLEF-2023 一部分的 AuTexTification 共享任务的方案。我们团队参与了第一个子任务,即识别由大语言模型而非人类生成的文本文档。组织者为该子任务提供了双语数据集,包含英语和西班牙语文本,涵盖多个领域,如法律文本、社交媒体帖子和操作指南文章。我们主要基于 Transformer 的深度学习模型进行实验,并采用多任务学习和虚拟对抗训练等训练技术以获取更好结果。我们提交了三次运行,其中两次由集成模型组成。我们表现最佳的模型在英语数据集上取得 66.63% 的宏 F1 分数,在西班牙语数据集上取得 67.10% 的宏 F1 分数。
引用
@article{arxiv.2308.01408,
title = {UPB at IberLEF-2023 AuTexTification: Detection of Machine-Generated Text using Transformer Ensembles},
author = {Andrei-Alexandru Preda and Dumitru-Clementin Cercel and Traian Rebedea and Costin-Gabriel Chiru},
journal= {arXiv preprint arXiv:2308.01408},
year = {2023}
}
备注
10 pages. Accepted for publication in the IberLEF 2023 Proceedings, at https://ceur-ws.org/