lm-evaluation-harness
EleutherAI's unified framework for evaluating language models on hundreds of academic benchmarks.
- Score
- 99.5052 signals
- Evidence
- 13,860 stars · 3,533 forks
- Last commit
- as last read from GitHub; most reads are from 2 Sep 2026 or later
- Listed
Install
No one-command install. Set it up from its source.
Alternatives · Evals
- helm2,898 stars · 412 forks98.706
What it is
EleutherAI's unified framework for evaluating language models on hundreds of academic benchmarks.
When to use it
EleutherAI's unified framework for evaluating language models on hundreds of academic benchmarks.
Notes
Curated evals entry. Verified 2026-05-27.