Navi-PfeilKI-Glossar

HumanEval

HumanEval ist ein standardisierter Test, bei dem KI-Modelle kleine Programmieraufgaben lösen müssen. Die Qualität wird dabei nicht nur sprachlich, sondern anhand automatisch überprüfbarer Code-Ausführung bewertet.

Worauf der Benchmark abzielt

Im Mittelpunkt steht die Fähigkeit, korrekten und funktionsfähigen Code zu schreiben. Damit eignet sich HumanEval besonders gut, um Coding-Kompetenz und logisches Problemlösen zu messen.

Bedeutung für die Modellbewertung

Für Systeme, die im Bereich Softwareentwicklung eingesetzt werden, ist HumanEval ein wichtiger Vergleichswert. Er zeigt, wie gut ein Modell strukturierte technische Aufgaben umsetzen kann.

Navi-PfeilKI-Glossar