Entries

Every published prompt in the registry, grouped by the suite it is scored against. A single entry can hold a score on several model versions at once.

status published103 entries across 5 suites

Multi step reasoning

180 cases · programmatic judgeView leaderboard

Refusal adherence

200 cases · hybrid judgeView leaderboard

Structured JSON extraction

240 cases · programmatic judgeView leaderboard

Summarization fidelity

160 cases · model judgeView leaderboard

Tool call accuracy

220 cases · programmatic judgeView leaderboard