AmbiK:厨房环境中的歧义任务数据集
机器学习
2025-06-05 v1 人工智能
计算与语言
机器人学
摘要
作为具身智能体的一部分,大语言模型(LLMs)通常用于根据用户的自然语言指令进行行为规划。然而,处理真实环境中的模糊指令仍然是 LLMs 面临的一项挑战。已提出多种任务歧义检测方法。然而,由于它们在不同的数据集上进行测试且缺乏通用基准,因此难以进行比较。为此,我们提出了 AmbiK(Ambiguous Tasks in Kitchen Environment),一个面向厨房环境中机器人指令的完全文本化的歧义指令数据集。AmbiK 在 LLMs 的辅助下收集,并经过人工验证。它包含 1000 对歧义任务及其无歧义对应任务,按歧义类型(人类偏好、常识知识、安全性)进行分类,并附有环境描述、澄清性问题与答案、用户意图和任务计划,共计 2000 个任务。我们希望 AmbiK 能够使研究人员对歧义检测方法进行统一比较。AmbiK 可在 https://github.com/cog-model/AmbiK-dataset 获取。
引用
@article{arxiv.2506.04089,
title = {AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment},
author = {Anastasiia Ivanova and Eva Bakaeva and Zoya Volovikova and Alexey K. Kovalev and Aleksandr I. Panov},
journal= {arXiv preprint arXiv:2506.04089},
year = {2025}
}
备注
ACL 2025 (Main Conference)