中文

ChatGPT内容检测:一种使用xlm-roberta对齐的新方法

机器学习 2025-11-27 v1

摘要

随着像ChatGPT这样的生成式AI技术变得越来越普及,区分AI生成的文本与人类撰写内容的挑战变得日益紧迫。在这项工作中,我们通过同时研究检测完全由AI生成的内容和识别被AI改写的人类文本,来解决这个问题。在我们的工作中,我们提出了一种使用XLM-RoBERTa(一种最先进的多语言Transformer模型)检测AI生成文本的综合方法。我们的方法包括严格的预处理,以及涉及困惑度、语义和可读性特征的特征提取。我们在一个由人类和AI生成文本组成的平衡数据集上对XLM-RoBERTa模型进行了微调,并评估了其性能。该模型在各种文本类型中表现出高准确率和稳健的性能。此外,我们进行了特征分析以理解模型的决策过程,揭示了困惑度和基于注意力的特征在区分人类和AI生成文本方面至关重要。我们的发现为维护学术诚信提供了有价值的工具,并通过促进AI系统的透明度和问责制,为更广泛的AI伦理领域做出了贡献。未来的研究方向包括探索其他先进模型并扩展数据集以增强模型的泛化能力。

关键词

引用

@article{arxiv.2511.21009,
  title  = {ChatGpt Content detection: A new approach using xlm-roberta alignment},
  author = {Md Tasnin Tanvir and Dr Santanu Kumar Dash and Ishan Shahnan and Nafis Fuad and Tanvir Rahman and Abdullah Al Faisal and Asadullah Al Mamun},
  journal= {arXiv preprint arXiv:2511.21009},
  year   = {2025}
}