MMLU ist ein standardisierter Test, bei dem ein Modell Fragen aus zahlreichen Wissensbereichen beantworten muss. Dazu gehören unter anderem Mathematik, Geschichte, Medizin, Recht und Naturwissenschaften.
Der Test soll zeigen, wie breit und belastbar das Wissensniveau eines Modells ist. Er eignet sich daher gut, um die allgemeine Leistungsfähigkeit von Sprachmodellen miteinander zu vergleichen.
Ein hoher MMLU-Wert kann ein Hinweis auf starke Wissensverarbeitung sein. Dennoch ersetzt der Benchmark keine praktische Prüfung, weil reale Anwendungen oft andere Anforderungen mitbringen.