BENCHMARKPAPER

AudioBench

面向音频大语言模型的通用评测基准。NAACL 2025。

理解音频模型真正听懂了什么。

如何系统评估音频大语言模型的能力?

我的工作

主导 AudioBench,覆盖 8 类任务与 26 个数据集,担任第一作者。

成果

通用音频语言评测基准,发表于 NAACL 2025。

项目背景与我的工作

音频语言模型需要在不同任务上接受系统评估。我主导 AudioBench,将 8 类任务与 26 个数据集纳入统一评测基准,并通过论文与代码公开评测设置。这项工作也与我在 MERaLiON AudioLLM 的数据准备和评测工作相互补充。