可信对话:人类与 AI 在生成对话中的观点
计算与语言
2024-09-11 v2 人工智能
摘要
随着对话系统和聊天机器人日益融入日常交互,高效且准确的评估方法变得至关重要。本研究探讨了人类与 AI 在多种对话场景中的比较性能,聚焦七个关键绩效指标(KPIs):连贯性、创造性、具体性、目标贡献、常识矛盾、错误事实和冗余性。我们利用 GPT-4o API 生成了多样化的对话数据集,并进行两部分实验分析。在实验 1 中,我们评估了多方对话中关于连贯性、创造性、具体性和目标贡献的表现,发现 GPT 模型与人类判断高度一致。值得注意的是,人类和 AI 评估者都倾向于二元判断而非线性评估,这凸显了这些评估中的共同挑战。实验 2 延续了 Finch 等人(2023)的工作,聚焦二人对话,评估常识矛盾、错误事实和冗余性。结果表明,尽管 GPT-4o 在保持事实准确性和常识推理方面表现出色,但在减少冗余性和自我矛盾方面仍有挑战。我们的发现强调了 GPT 模型在对话系统中接近模仿人类评估的潜力,同时指出了改进的方向。本研究为推动更精细的对话评估方法的发展与实施提供了有价值的见解,促进了更有效、更贴近人类的 AI 交流工具的演进。
引用
@article{arxiv.2409.01808,
title = {Dialogue You Can Trust: Human and AI Perspectives on Generated Conversations},
author = {Ike Ebubechukwu and Johane Takeuchi and Antonello Ceravola and Frank Joublin},
journal= {arXiv preprint arXiv:2409.01808},
year = {2024}
}
备注
17 pages, 15 figures