以NICO数据集促进大语言模型中的自然对话
计算与语言
2024-10-16 v2
摘要
得益于多样化的指令数据集,当代大语言模型(LLMs)作为AI助手在与人类协作方面表现出色。然而,在聊天机器人和心理咨询等需要更类人交互的现实应用中,LLMs仍难以生成自然且口语化的回复。为解决这些局限,我们引入了NICO,一个中文自然交互对话数据集。我们首先使用GPT-4-turbo生成对话草稿,使其覆盖20个日常生活主题和5种社交互动类型。然后,我们雇佣工作人员修改这些对话,确保其没有语法错误和不自然的表述。我们定义了两个对话级别的自然对话任务和两个句子级别的任务,用于识别和改写不自然的句子。我们测试并详细分析了多个开源和闭源LLM。实验结果突显了这些任务的挑战性,并展示了NICO如何有助于培养LLM的自然对话能力。该数据集将公开发布。
引用
@article{arxiv.2408.09330,
title = {Fostering Natural Conversation in Large Language Models with NICO: a Natural Interactive COnversation dataset},
author = {Renliang Sun and Mengyuan Liu and Shiping Yang and Rui Wang and Junqing He and Jiaxing Zhang},
journal= {arXiv preprint arXiv:2408.09330},
year = {2024}
}
备注
16 pages, 3 figures, 10 tables