research
Papers
81 papers with benchmark results from arxiv, tagged by theme
Small Beats Big 11Agent 12Coding 11OCR 10Efficient 5Frontier 5Reasoning 4VLM 3Browser Agent 2Distillation 2Small VLM 2Test Time Compute 2Autoregressive 1Data Curation 1Diffusion LLM 1Model Release 1MOE 1OCR Document 1Quantization 1Rlvr 1Safety Evaluation 1Small Models 1Tool Use 1Vision Language 1
Filtering by: Small Beats Big · clear
Small Beats Big
11 papers
Do Domain-specific Experts exist in MoE-based LLMs?
2026-04-07 · arxiv
Small Beats BigArchitectureMOE
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
2026-04-06 · arxiv
Small Beats BigDistillationReasoning
Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents
2026-04-06 · arxiv
Small Beats BigDistillationData CentricAgentic SearchBrowsecomp
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
2026-04-03 · arxiv
Small Beats BigDistillationReasoning
S3: Stratified Scaling Search for Test-Time in Diffusion Language Models
2026-04-02 · arxiv
Small Beats BigTest Time ComputeArchitectureDiffusion Lm
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
2026-04-02 · arxiv
Small Beats BigEfficient TrainingReasoning
Embarrassingly Simple Self-Distillation Improves Code Generation
2026-04-01 · arxiv
Small Beats BigCodingSelf DistillationEfficient
SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology
2026-03-30 · arxiv
Small Beats BigEfficient TrainingReasoning
Do Post-Training Algorithms Actually Differ? A Controlled Study Across Model Scales Uncovers Scale-Dependent Ranking Inversions
2026-03-19 · arxiv
Small Beats BigEfficient Training
Beyond Test-Time Training: Learning to Reason via Hardware-Efficient Optimal Control
2026-03-10 · arxiv
Small Beats BigTest Time ComputeArchitecture
DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning
2026-03-05 · arxiv
Small Beats BigTest Time ComputeReasoning