自适应分词边界:将人类组块机制融入多模态大语言模型
计算与语言
2025-05-09 v1 人工智能
摘要
多模态大语言模型(MLLMs)的最新进展展示了其在处理多种数据类型方面的卓越能力,然而,人类认知过程与多模态信息整合的计算方法之间仍然存在显著差异。本研究对人类跨模态组块机制与MLLMs中的分词表示方法之间的相似性进行了系统性研究。通过比较人类在视觉-语言任务中的表现模式与模型行为的实证研究,我们证明传统的静态分词方案从根本上限制了当前模型模拟人类信息处理动态、上下文敏感特性的能力。我们提出了一种新颖的动态跨模态分词框架,该框架融合了基于认知科学原理的自适应边界、层次化表示和对齐机制。定量评估表明,我们的方法在基准任务上相比最先进的模型取得了统计学上显著的改进(视觉问答任务提升7.8%,复杂场景描述任务提升5.3%),同时展现出更符合人类认知的错误模式和注意力分布。这些发现有助于从理论上理解人类认知与人工智能之间的关系,并为开发更具认知合理性的AI系统提供了实证证据。
引用
@article{arxiv.2505.04637,
title = {Adaptive Token Boundaries: Integrating Human Chunking Mechanisms into Multimodal LLMs},
author = {Dongxing Yu},
journal= {arXiv preprint arXiv:2505.04637},
year = {2025}
}