Eval frameworks · framework
Inspect AI
Build agent, tool-use and model evaluations with reusable scoring and sandboxes.
What it measures
Evaluation-defined scores
Includes an evaluation collection; external model calls and sandboxes need local setup.
Public evaluation code. Check upstream code and dataset terms.
Open source / dataset · Run instructions
Reported ranking tracks
No numeric ranking has been imported for this project. Read the upstream results and instructions.