中文

DESAMO:一种由嵌入式音频模态大语言模型驱动的老年友好型智能家居设备

人机交互 2025-08-27 v1 声音 音频与语音处理

摘要

我们提出了 DESAMO,一种由音频大语言模型(Audio LLM)驱动的、适合老年人使用的设备端智能家居系统,支持自然且私密的交互。传统语音助手依赖于基于自动语音识别(ASR)的流水线或 ASR-LLM 级联,通常难以处理老年人用户中常见的含糊语音,且无法处理非语音音频。而 DESAMO 利用音频大语言模型直接处理原始音频输入,从而能够鲁棒地理解用户意图和关键事件,例如跌倒或呼救。

关键词

引用

@article{arxiv.2508.18918,
  title  = {DESAMO: A Device for Elder-Friendly Smart Homes Powered by Embedded LLM with Audio Modality},
  author = {Youngwon Choi and Donghyuk Jung and Hwayeon Kim},
  journal= {arXiv preprint arXiv:2508.18918},
  year   = {2025}
}

备注

2 pages, 2 figures. Accepted for presentation as a UIST 2025 Poster