BENCHMARKPAPER

SeaEval

多语言评测基准 —— 跨语言对齐与跨文化推理。NAACL 2024。

让 AI 跨越语言与文化。

多语言模型能否在不同语言与文化之间保持知识和推理能力?

我的工作

主导 SeaEval,评估跨语言一致性与文化推理,担任共同第一作者。

成果

多语言评测基准,发表于 NAACL 2024。

项目背景与我的工作

当同一知识换一种语言或文化语境表达时,多语言模型的表现可能发生变化。我主导 SeaEval,与合作者一起构建基准,评估跨语言一致性与文化推理,并以共同第一作者身份发表于 NAACL 2024。