benchmark
.
space
benchmarks
rankings
compare
voices
transcripts
papers
articles
research
Papers
81 papers with benchmark results from arxiv, tagged by theme
Small Beats Big
11
Agent
12
Coding
11
OCR
10
Efficient
5
Frontier
5
Reasoning
4
VLM
3
Browser Agent
2
Distillation
2
Small VLM
2
Test Time Compute
2
Autoregressive
1
Data Curation
1
Diffusion LLM
1
Model Release
1
MOE
1
OCR Document
1
Quantization
1
Rlvr
1
Safety Evaluation
1
Small Models
1
Tool Use
1
Vision Language
1
Filtering by:
Reasoning
·
clear
Reasoning
4 papers
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
2026-04-09 · arxiv
Reasoning
Small Models
Model Release
Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution
2026-04-09 · arxiv
Reasoning
Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning
2026-04-02 · arxiv
Reasoning
ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence
2026-03-24 · arxiv
Reasoning