中文

Sharif-MGTD at SemEval-2024 Task 8:基于Transformer的机器生成文本检测方法

计算与语言 2025-02-19 v1 人工智能

摘要

机器生成文本(MGT)检测已成为自然语言处理领域的重要研究方向。虽然语言模型会生成文本,但常会留下可被辨识的痕迹,这些痕迹可通过传统特征方法或更先进的神经语言模型进行分析。本研究探索了对RoBERTa-base transformer进行微调的有效性,以将MGT检测作为二分类任务来解决。我们专注于SemEval-2024竞赛框架中的子任务A(单语种英文),我们提出的系统在测试数据集上 achieves 78.9%的准确率,位列参赛者第57名。我们的研究在考虑有限硬件资源的同时解决了这一挑战, resulting in a system that excels at identifying human-written texts but encounters challenges in accurately discerning MGTs.

关键词

引用

@article{arxiv.2407.11774,
  title  = {Sharif-MGTD at SemEval-2024 Task 8: A Transformer-Based Approach to Detect Machine Generated Text},
  author = {Seyedeh Fatemeh Ebrahimi and Karim Akhavan Azari and Amirmasoud Iravani and Arian Qazvini and Pouya Sadeghi and Zeinab Sadat Taghavi and Hossein Sameti},
  journal= {arXiv preprint arXiv:2407.11774},
  year   = {2025}
}

备注

8 pages, 3 figures, 2 tables. Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024)