WildChat:100 万条真实场景下的 ChatGPT 交互日志
计算与语言
2024-05-03 v1
摘要
诸如 GPT-4 和 ChatGPT 等聊天机器人目前正在为数百万用户服务。尽管它们被广泛使用,但仍然缺乏公开的数据集来展示大量用户在实践中如何使用这些工具。为了弥补这一差距,我们向在线用户提供免费的 ChatGPT 访问权限,以换取他们明确、自愿的选择加入,从而匿名收集他们的聊天记录和请求头。由此,我们编制了 WildChat,这是一个包含 100 万条用户与 ChatGPT 对话的语料库,由超过 250 万个交互轮次组成。我们将 WildChat 与其他流行的用户-聊天机器人交互数据集进行了比较,发现我们的数据集提供了最多样化的用户提示,包含最多数量的语言,并呈现了最丰富的潜在有害用例供研究人员研究。除了带有时间戳的聊天记录外,我们还在数据集中补充了人口统计数据,包括州、国家和哈希 IP 地址,以及请求头。这种增强允许对不同地理区域和时间维度的用户行为进行更详细的分析。最后,由于它涵盖了广泛的用例,我们展示了该数据集在微调指令遵循模型方面的潜在效用。WildChat 已在 https://wildchat.allen.ai 上根据 AI2 ImpACT 许可证发布。
关键词
引用
@article{arxiv.2405.01470,
title = {WildChat: 1M ChatGPT Interaction Logs in the Wild},
author = {Wenting Zhao and Xiang Ren and Jack Hessel and Claire Cardie and Yejin Choi and Yuntian Deng},
journal= {arXiv preprint arXiv:2405.01470},
year = {2024}
}
备注
accepted by ICLR 2024