research
Papers
81 papers with benchmark results from arxiv, tagged by theme
Small Beats Big 11Agent 12Coding 11OCR 10Efficient 5Frontier 5Reasoning 4VLM 3Browser Agent 2Distillation 2Small VLM 2Test Time Compute 2Autoregressive 1Data Curation 1Diffusion LLM 1Model Release 1MOE 1OCR Document 1Quantization 1Rlvr 1Safety Evaluation 1Small Models 1Tool Use 1Vision Language 1
Small Beats Big
11 papers
Do Domain-specific Experts exist in MoE-based LLMs?
2026-04-07 · arxiv
Small Beats BigArchitectureMOE
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
2026-04-06 · arxiv
Small Beats BigDistillationReasoning
Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents
2026-04-06 · arxiv
Small Beats BigDistillationData CentricAgentic SearchBrowsecomp
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
2026-04-03 · arxiv
Small Beats BigDistillationReasoning
S3: Stratified Scaling Search for Test-Time in Diffusion Language Models
2026-04-02 · arxiv
Small Beats BigTest Time ComputeArchitectureDiffusion Lm
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
2026-04-02 · arxiv
Small Beats BigEfficient TrainingReasoning
Embarrassingly Simple Self-Distillation Improves Code Generation
2026-04-01 · arxiv
Small Beats BigCodingSelf DistillationEfficient
SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology
2026-03-30 · arxiv
Small Beats BigEfficient TrainingReasoning
Do Post-Training Algorithms Actually Differ? A Controlled Study Across Model Scales Uncovers Scale-Dependent Ranking Inversions
2026-03-19 · arxiv
Small Beats BigEfficient Training
Beyond Test-Time Training: Learning to Reason via Hardware-Efficient Optimal Control
2026-03-10 · arxiv
Small Beats BigTest Time ComputeArchitecture
DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning
2026-03-05 · arxiv
Small Beats BigTest Time ComputeReasoning
Agent
12 papers
Structured Distillation of Web Agent Capabilities Enables Generalization
2026-04-09 · arxiv
Agent
IntentScore: Intent-Conditioned Action Evaluation for Computer-Use Agents
2026-04-06 · arxiv
AgentTool Use
Beyond Fixed Tests: Repository-Level Issue Resolution as Coevolution of Code and Behavioral Constraints
2026-04-06 · arxiv
AgentCoding
InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking
2026-04-03 · arxiv
AgentSearch AgentMulti Agent
Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
2026-03-30 · arxiv
AgentSearch AgentVerification
Seed1.8 Model Card: Towards Generalized Real-World Agency
2026-03-21 · arxiv
AgentFoundation ModelMultimodal
WebNavigator: Global Web Navigation via Interaction Graph Retrieval
2026-03-20 · arxiv
AgentWeb AgentNavigation
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents
2026-03-20 · arxiv
AgentWeb AgentRlSmall Model
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
2026-03-16 · arxiv
AgentSearch AgentOpen Source
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents (GUI-Owl-1.5)
2026-02-15 · arxiv
Agent
OpAgent: Operator Agent for Web Navigation
2026-02-14 · arxiv
Agent
Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents
2026-02-03 · arxiv
Agent
Coding
11 papers
ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision?
2026-04-09 · arxiv
CodingSmall ModelRlvr
Awakening the Sleeping Agent: Lean-Specific Agentic Data Reactivates General Tool Use in Goedel Prover
2026-04-09 · arxiv
CodingFormal MathModel Release
ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents
2026-04-09 · arxiv
CodingSwe Bench
CODESTRUCT: Code Agents over Structured Action Spaces
2026-04-07 · arxiv
Coding
InCoder-32B-Thinking: Industrial Code World Model for Thinking
2026-04-03 · arxiv
Coding
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
2026-04-02 · arxiv
Coding
Yet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMs
2026-04-01 · arxiv
Coding
KAT-Coder-V2 Technical Report
2026-03-29 · arxiv
Coding
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code
2026-03-06 · arxiv
Coding
Qwen3-Coder-Next Technical Report
2026-02-28 · arxiv
Coding
SWE-Protege: Learning to Selectively Collaborate With an Expert Unlocks Small Language Models as Software Engineering Agents
2026-02-25 · arxiv
Coding
OCR
10 papers
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
2026-04-06 · arxiv
OCR
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
2026-04-03 · arxiv
OCR
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
2026-03-31 · arxiv
OCR
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
2026-03-25 · arxiv
OCR
Agentar-Fin-OCR
2026-03-11 · arxiv
OCR
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
2026-03-11 · arxiv
OCR
GLM-OCR Technical Report
2026-03-11 · arxiv
OCR
DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding
2026-03-08 · arxiv
OCR
FireRed-OCR Technical Report
2026-03-02 · arxiv
OCR
PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust Document Parsing
2026-01-29 · arxiv
OCR
Efficient
5 papers
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
2026-04-09 · arxiv
Efficient
ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
2026-04-07 · arxiv
Efficient
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
2026-03-19 · arxiv
Efficient
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
2026-01-15 · arxiv
Efficient
MiMo-V2-Flash Technical Report
2026-01-06 · arxiv
Efficient
Frontier
5 papers
Dead Weights, Live Signals: Feedforward Graphs of Frozen Language Models
2026-04-09 · arxiv
FrontierModel CombinationSmall Model
Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents
2026-04-08 · arxiv
FrontierAgentReasoning
Multi-objective Evolutionary Merging Enables Efficient Reasoning Models
2026-04-07 · arxiv
FrontierReasoningModel Merging
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
2026-04-06 · arxiv
FrontierReasoningSearch
Phi-4-reasoning-vision-15B Technical Report
2026-03-04 · arxiv
FrontierNew ModelVLMSmall Model
Reasoning
4 papers
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
2026-04-09 · arxiv
ReasoningSmall ModelsModel Release
Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution
2026-04-09 · arxiv
Reasoning
Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning
2026-04-02 · arxiv
Reasoning
ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence
2026-03-24 · arxiv
Reasoning
VLM
3 papers
Vero: An Open RL Recipe for General Visual Reasoning
2026-04-06 · arxiv
VLM
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
2026-03-06 · arxiv
VLM
STEP3-VL-10B Technical Report
2026-01-14 · arxiv
VLM
Browser Agent
2 papers
KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
2026-04-09 · arxiv
Browser AgentBenchmarkMobile
Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction
2026-04-07 · arxiv
Browser AgentGuiModel Release
Distillation
2 papers
Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
2026-04-09 · arxiv
DistillationSmall Beats BigOn Policy DistillationMath Reasoning
Cross-Tokenizer LLM Distillation through a Byte-Level Interface
2026-04-08 · arxiv
DistillationSmall Beats BigCross TokenizerByte Level
Small VLM
2 papers
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
2026-04-06 · arxiv
Small VLMMultimodalEfficient
Empirical Recipes for Efficient and Compact Vision-Language Models
2026-03-17 · arxiv
Small VLMMultimodalEfficient
Test Time Compute
2 papers
TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis
2026-04-09 · arxiv
Test Time ComputeRlvrSmall Model
SeLaR: Selective Latent Reasoning in Large Language Models
2026-04-09 · arxiv
Test Time ComputeLatent ReasoningSmall Model
Autoregressive
1 paper
MARS: Enabling Autoregressive Models Multi-Token Generation
2026-04-09 · arxiv
AutoregressiveMulti TokenEfficiencyMathCode
Data Curation
1 paper
FLUX: Data Worth Training On
2026-03-14 · arxiv
Data CurationSmall Beats BigEfficient TrainingPretraining
Diffusion LLM
1 paper
DMax: Aggressive Parallel Decoding for dLLMs
2026-04-10 · arxiv
Diffusion LLMParallel DecodingEfficiencyMathCode
Model Release
1 paper
JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency
2026-04-03 · arxiv
Model ReleaseReasoningCodingSmall Models
MOE
1 paper
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
2026-04-09 · arxiv
MOEMultimodalRouting
OCR Document
1 paper
OmniDocBench Leaderboard Update (2026/03/31)
2026-03-31 · arxiv
OCR Document
Quantization
1 paper
SliderQuant: Accurate Post-Training Quantization for LLMs
2026-03-26 · arxiv
QuantizationSmall Beats BigModel CompressionEfficient Inference
Rlvr
1 paper
Self-Distilled RLVR
2026-04-06 · arxiv
RlvrSelf DistillationPost TrainingMultimodal Reasoning
Safety Evaluation
1 paper
Claude Mythos Preview System Card
2026-04-07 · arxiv
Safety Evaluation
Small Models
1 paper
Gemma 4, Phi-4, and Qwen3: Accuracy-Efficiency Tradeoffs in Dense and MoE Reasoning Language Models
2026-04-08 · arxiv
Small ModelsReasoning
Tool Use
1 paper
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
2026-04-09 · arxiv
Tool UseSmall ModelMath Reasoning
Vision Language
1 paper
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
2026-04-09 · arxiv
Vision Language