Armory
Source
Browse
Evals

lm-evaluation-harness

EleutherAI's unified framework for evaluating language models on hundreds of academic benchmarks.

Score
99.5052 signals
Evidence
13,860 stars · 3,533 forks
Last commit
as last read from GitHub; most reads are from 2 Sep 2026 or later
Listed

Install

No one-command install. Set it up from its source.

Alternatives · Evals

  1. helm2,898 stars · 412 forks98.706

What it is

EleutherAI's unified framework for evaluating language models on hundreds of academic benchmarks.

When to use it

EleutherAI's unified framework for evaluating language models on hundreds of academic benchmarks.

Notes

Curated evals entry. Verified 2026-05-27.