ChatHuman:与3D人类交谈
计算机视觉与模式识别
2025-05-30 v2 机器学习
摘要
已提出许多方法来检测、估计和分析图像中人的属性,包括3D姿态、形状、接触、人物-物体交互和情感。虽然这些方法在视觉领域及其他领域具有广泛应用,但需要专业知识才能选择、使用和解释其结果。为此,我们引入ChatHuman,一个面向语言驱动的系统,将专用方法的能力整合到统一框架中。ChatHuman作为擅长利用、分析和与特定于3D人类任务的工具交互的助手,熟练地讨论和解决相关挑战。基于大型语言模型(LLM)框架构建,ChatHuman被训练能够自主选择、应用和解释以响应用户输入而产生的多样化工具集合。我们的做法克服了将LLM适应3D人类任务的重大障碍,包括需要领域特定知识以及能够解释复杂3D输出的能力。ChatHuman的创新包括利用学术出版物指导LLM使用工具,采用检索增强生成模型为管理新工具创建情境学习示例,以及通过将专用3D输出转换为易于理解的格式来有效区分和集成工具结果。实验表明,ChatHuman在各种3D人类任务中超越现有模型在工具选择准确率和整体性能方面。它支持与用户的交互式对话。ChatHuman是将多种分析方法整合到统一、稳健的3D人类任务系统中的重要一步。
引用
@article{arxiv.2405.04533,
title = {ChatHuman: Chatting about 3D Humans with Tools},
author = {Jing Lin and Yao Feng and Weiyang Liu and Michael J. Black},
journal= {arXiv preprint arXiv:2405.04533},
year = {2025}
}
备注
Project page: https://chathuman.github.io