BENCHMARKPAPER
AudioBench
面向音频大语言模型的通用评测基准。NAACL 2025。
音频模型评测
从输入到可检验的结果
理解音频模型真正听懂了什么。
如何系统评估音频大语言模型的能力?
我的工作
主导 AudioBench,覆盖 8 类任务与 26 个数据集,担任第一作者。
成果
通用音频语言评测基准,发表于 NAACL 2025。
项目背景与我的工作
音频语言模型需要在不同任务上接受系统评估。我主导 AudioBench,将 8 类任务与 26 个数据集纳入统一评测基准,并通过论文与代码公开评测设置。这项工作也与我在 MERaLiON AudioLLM 的数据准备和评测工作相互补充。