中文

RKadiyala 在 SemEval-2024 任务 8:部分机器生成文本中的黑盒词级文本边界检测

计算与语言 2024-10-23 v1 人工智能 机器学习

摘要

随着生成模型在文本生成中的日益普及以及机器生成文本在各个领域的广泛使用,区分人类撰写的文本和机器生成的文本是一项重大挑战。虽然现有模型和专有系统专注于识别给定文本是完全由人类撰写还是完全由机器生成,但只有少数系统能够在句子或段落级别提供关于其为机器生成可能性的洞察,且准确性不可靠,仅对一组领域和生成器有效。本文介绍了几种可靠的方法,用于在词级别识别给定文本的哪一部分是机器生成的,同时比较了不同方法和途径的结果。我们与专有系统进行了比较,展示了我们的模型在未见领域和生成器文本上的性能。研究结果揭示了检测准确性的显著提升,以及对检测能力其他方面的比较。最后,我们讨论了潜在的改进途径和我们工作的意义。所提出的模型也非常适合检测许多 LLM 的 Instruct 变体输出中文本的哪些部分是机器生成的。

关键词

引用

@article{arxiv.2410.16659,
  title  = {RKadiyala at SemEval-2024 Task 8: Black-Box Word-Level Text Boundary Detection in Partially Machine Generated Texts},
  author = {Ram Mohan Rao Kadiyala},
  journal= {arXiv preprint arXiv:2410.16659},
  year   = {2024}
}

备注

published at naacl 2024