作品。

从研究问题到模型、评测与可用的工具。

01 / 研究与实践

代表工作。

智能体与推理 Apodex · 2025–present

Apodex 1.1

让推理走向任务完成。

智能体如何结合文件、搜索、代码与协作,完成复杂的研究任务?

我的工作
在 Apodex 从零搭建深度研究智能体框架,设计证据验证与多智能体协作。
成果
面向复杂研究的模型与工作台,以及开源 FrontierAgent 执行框架。

音频与评测 I²R, A*STAR · NAACL 2025

AudioBench

理解音频模型真正听懂了什么。

如何系统评估音频大语言模型的能力?

我的工作
主导 AudioBench,覆盖 8 类任务与 26 个数据集,担任第一作者。
成果
通用音频语言评测基准,发表于 NAACL 2025。

语言与文化 I²R, A*STAR · NAACL 2024

SeaEval

让 AI 跨越语言与文化。

多语言模型能否在不同语言与文化之间保持知识和推理能力?

我的工作
主导 SeaEval,评估跨语言一致性与文化推理,担任共同第一作者。
成果
多语言评测基准,发表于 NAACL 2024。

早期研究成果。

此前参与的模型与框架工作。

工具、资源与个人项目。

我维护的资源库与个人实验。