中文

利用基于多模态机器学习的对话视频人类行为分析工具为专家提供支持

人机交互 2024-02-20 v1 计算机视觉与模式识别 机器学习

摘要

对话的多模态场景搜索对于揭示社会动态的深刻见解和提升我们的沟通至关重要。尽管对话分析专家拥有寻找关键场景的自身知识与技能,但缺乏能够简化多样化多模态查询处理的全面且用户友好的工具,阻碍了效率与客观性。为解决此问题,我们开发了 Providence,一款基于可视化编程的工具,其设计考量源自对专家的形成性研究。它使专家能够组合各种机器学习算法来捕捉人类行为线索,而无需编写代码。我们的研究表明,该工具在完成对话场景搜索任务时具有更佳的可用性和令人满意的输出,且施加的认知负荷更低,验证了其可定制性与透明度的重要性。此外,通过实地试验,我们确认了该工具的客观性与可重用性改变了专家的工作流程,表明了在高度人类情境化领域中专家与 AI 协作的优势。

关键词

引用

@article{arxiv.2402.11145,
  title  = {Supporting Experts with a Multimodal Machine-Learning-Based Tool for Human Behavior Analysis of Conversational Videos},
  author = {Riku Arakawa and Kiyosu Maeda and Hiromu Yakura},
  journal= {arXiv preprint arXiv:2402.11145},
  year   = {2024}
}