面向语言引导的抓取-放置操作的预测3D表示:Forecast-GS
摘要
我们引入Forecast-aware Gaussian Splatting(Forecast-GS),一种面向语言条件机器人操作的预测3D表示框架。虽然近期操作系统通过将语言指令 grounding 到机器人 affordance、value map或关系关键点约束方面取得进展,但通常仅推理当前场景,不显式建模任务完成状态。当成功取决于满足空间和语义目标且仅有部分观测时,机器人必须评估候选动作是否导致可行的任务一致结果。这一限制在部分观测下尤为关键。我们在真实的抓取-放置操作任务中验证Forecast-GS,包括Cutter-to-Box、Apple-to-Bowl和Sponge-to-Tray。对于每个任务,我们在相同机器人平台和感知 setup下进行25次真实操作,初始物体配置各异。Forecast-GS通过自动候选选择,在三个任务上分别实现21/25、23/25和16/25的成功率,而ReKep基线分别为15/25、19/25和10/25。诊断性的人工辅助设置进一步提升至23/25、24/25和19/25,表明候选生成有效但自动排序仍不完美。这些结果表明,显式预测任务完成的3D状态可实现更可靠的动作评估,而自动与人工辅助选择之间的差距表明鲁棒的最终状态排序仍是完全自主操作的重要挑战。总体而言,Forecast-GS为语言理解、3D感知与机器人操作规划之间提供了可解释的桥梁。
引用
@article{arxiv.2605.11143,
title = {ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV},
author = {Alex Stinard},
journal= {arXiv preprint arXiv:2605.11143},
year = {2026}
}
备注
46 pages including appendices (two-column preprint format). Under review at JAMIA. Code, frozen evaluator, and benchmark released at https://huggingface.co/datasets/alexstinard/epikg-clinicalbench. ClinicalBench v2 is a 400-question MIMIC-IV stress test for assertion-aware retrieval