中文

Hugging Face上对通用LLM与多模态LLM认知的实证研究

软件工程 2026-04-08 v1

摘要

大语言模型(LLMs)已从通用系统快速演变为能够处理文本、图像和音频的多模态模型。随着通用LLM(GLLMs)和多模态LLM(MLLMs)的广泛采用,理解现实世界环境中的用户认知变得越来越重要。然而,现有研究通常依赖调查或平台特定数据(如Reddit或GitHub问题),这些数据要么通过预定义问题限制用户反馈,要么过度强调以失败为导向的调试讨论,从而未能捕捉实践中多样化的、基于经验的和跨模型的用户视角。为了解决这个问题,我们在Hugging Face——一个拥有多样化模型和活跃社区的主要模型中心——上对用户讨论进行了实证研究。我们收集并手动标注了来自38个代表性模型(21个GLLM和17个MLLM)的662个讨论线程,并开发了一个三级分类法来系统地描述用户关注点。我们的分析表明,LLM访问障碍、生成质量以及部署和调用复杂性是最突出的关注点,此外还有文档限制和资源约束等问题。基于这些发现,我们为改善LLM生态系统推导了可操作的启示。

关键词

引用

@article{arxiv.2604.05782,
  title  = {An Empirical Study of Perceptions of General LLMs and Multimodal LLMs on Hugging Face},
  author = {Yujian Liu and Xiao Yu and Jacky Keung and Xing Hu and Xin Xia and Xiaoxue Ma},
  journal= {arXiv preprint arXiv:2604.05782},
  year   = {2026}
}