X-TURING:面向长期对话代理的增强型高效图灵测试
计算与语言
2025-05-30 v2 人工智能
摘要
图灵测试检验AI在自然语言对话中是否表现出类人行为。传统设置将每个参与者限制为一次一条消息,并要求持续的人工参与。这无法反映自然的对话风格,并阻碍了对基于大语言模型(LLM)的对话代理在复杂和长期交互中的评估。本文提出\textbf{\textsc{X-Turing}},通过引入\textit{突发对话}模式增强原始测试,允许使用连续消息进行更动态的交换。它进一步通过迭代生成模拟代理与人之间长期交互的对话来减少人工工作量,从而组成测试过程的大部分。通过\textit{伪对话}历史,代理随后与真实人类进行较短的对话,该对话与同一主题的人-人对话配对,并通过问卷进行判断。我们引入\textit{X-Turn Pass-Rate}指标来评估LLM在不同持续时间下的类人程度。虽然像GPT-4这样的LLM最初表现良好,在3轮和10轮对话中分别达到51.9%和38.9%的通过率,但随着对话的进行其性能下降,这强调了在长期内保持一致性的困难。
引用
@article{arxiv.2408.09853,
title = {X-TURING: Towards an Enhanced and Efficient Turing Test for Long-Term Dialogue Agents},
author = {Weiqi Wu and Hongqiu Wu and Hai Zhao},
journal= {arXiv preprint arXiv:2408.09853},
year = {2025}
}
备注
Accepted to ACL 2025 Main Conference