benchmark
.
space
benchmarks
rankings
compare
voices
transcripts
papers
articles
research
Papers
81 papers with benchmark results from arxiv, tagged by theme
Small Beats Big
11
Agent
12
Coding
11
OCR
10
Efficient
5
Frontier
5
Reasoning
4
VLM
3
Browser Agent
2
Distillation
2
Small VLM
2
Test Time Compute
2
Autoregressive
1
Data Curation
1
Diffusion LLM
1
Model Release
1
MOE
1
OCR Document
1
Quantization
1
Rlvr
1
Safety Evaluation
1
Small Models
1
Tool Use
1
Vision Language
1
Filtering by:
Small Beats Big
·
clear
Small Beats Big
11 papers
Do Domain-specific Experts exist in MoE-based LLMs?
2026-04-07 · arxiv
Small Beats Big
Architecture
MOE
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
2026-04-06 · arxiv
Small Beats Big
Distillation
Reasoning
Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents
2026-04-06 · arxiv
Small Beats Big
Distillation
Data Centric
Agentic Search
Browsecomp
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
2026-04-03 · arxiv
Small Beats Big
Distillation
Reasoning
S3: Stratified Scaling Search for Test-Time in Diffusion Language Models
2026-04-02 · arxiv
Small Beats Big
Test Time Compute
Architecture
Diffusion Lm
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
2026-04-02 · arxiv
Small Beats Big
Efficient Training
Reasoning
Embarrassingly Simple Self-Distillation Improves Code Generation
2026-04-01 · arxiv
Small Beats Big
Coding
Self Distillation
Efficient
SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology
2026-03-30 · arxiv
Small Beats Big
Efficient Training
Reasoning
Do Post-Training Algorithms Actually Differ? A Controlled Study Across Model Scales Uncovers Scale-Dependent Ranking Inversions
2026-03-19 · arxiv
Small Beats Big
Efficient Training
Beyond Test-Time Training: Learning to Reason via Hardware-Efficient Optimal Control
2026-03-10 · arxiv
Small Beats Big
Test Time Compute
Architecture
DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning
2026-03-05 · arxiv
Small Beats Big
Test Time Compute
Reasoning