research
Papers
81 papers with benchmark results from arxiv, tagged by theme
Do Domain-specific Experts exist in MoE-based LLMs?
2026-04-07 · arxiv
Small Beats BigArchitectureMOE
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
2026-04-06 · arxiv
Small Beats BigDistillationReasoning
Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents
2026-04-06 · arxiv
Small Beats BigDistillationData CentricAgentic SearchBrowsecomp
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
2026-04-03 · arxiv
Small Beats BigDistillationReasoning
S3: Stratified Scaling Search for Test-Time in Diffusion Language Models
2026-04-02 · arxiv
Small Beats BigTest Time ComputeArchitectureDiffusion Lm
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
2026-04-02 · arxiv
Small Beats BigEfficient TrainingReasoning
Embarrassingly Simple Self-Distillation Improves Code Generation
2026-04-01 · arxiv
Small Beats BigCodingSelf DistillationEfficient
SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology
2026-03-30 · arxiv
Small Beats BigEfficient TrainingReasoning
Do Post-Training Algorithms Actually Differ? A Controlled Study Across Model Scales Uncovers Scale-Dependent Ranking Inversions
2026-03-19 · arxiv
Small Beats BigEfficient Training
Beyond Test-Time Training: Learning to Reason via Hardware-Efficient Optimal Control
2026-03-10 · arxiv
Small Beats BigTest Time ComputeArchitecture
DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning
2026-03-05 · arxiv
Small Beats BigTest Time ComputeReasoning
Structured Distillation of Web Agent Capabilities Enables Generalization
2026-04-09 · arxiv
Agent
IntentScore: Intent-Conditioned Action Evaluation for Computer-Use Agents
2026-04-06 · arxiv
AgentTool Use
Beyond Fixed Tests: Repository-Level Issue Resolution as Coevolution of Code and Behavioral Constraints
2026-04-06 · arxiv
AgentCoding
InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking
2026-04-03 · arxiv
AgentSearch AgentMulti Agent
Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
2026-03-30 · arxiv
AgentSearch AgentVerification
Seed1.8 Model Card: Towards Generalized Real-World Agency
2026-03-21 · arxiv
AgentFoundation ModelMultimodal
WebNavigator: Global Web Navigation via Interaction Graph Retrieval
2026-03-20 · arxiv
AgentWeb AgentNavigation
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents
2026-03-20 · arxiv
AgentWeb AgentRlSmall Model
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
2026-03-16 · arxiv
AgentSearch AgentOpen Source
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents (GUI-Owl-1.5)
2026-02-15 · arxiv
Agent
OpAgent: Operator Agent for Web Navigation
2026-02-14 · arxiv
Agent
Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents
2026-02-03 · arxiv
Agent
ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision?
2026-04-09 · arxiv
CodingSmall ModelRlvr
Awakening the Sleeping Agent: Lean-Specific Agentic Data Reactivates General Tool Use in Goedel Prover
2026-04-09 · arxiv
CodingFormal MathModel Release
ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents
2026-04-09 · arxiv
CodingSwe Bench
CODESTRUCT: Code Agents over Structured Action Spaces
2026-04-07 · arxiv
Coding
InCoder-32B-Thinking: Industrial Code World Model for Thinking
2026-04-03 · arxiv
Coding
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
2026-04-02 · arxiv
Coding
Yet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMs
2026-04-01 · arxiv
Coding
KAT-Coder-V2 Technical Report
2026-03-29 · arxiv
Coding
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code
2026-03-06 · arxiv
Coding
Qwen3-Coder-Next Technical Report
2026-02-28 · arxiv
Coding
SWE-Protege: Learning to Selectively Collaborate With an Expert Unlocks Small Language Models as Software Engineering Agents
2026-02-25 · arxiv
Coding
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
2026-04-06 · arxiv
OCR
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
2026-04-03 · arxiv
OCR
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
2026-03-31 · arxiv
OCR
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training
2026-03-25 · arxiv
OCR
Agentar-Fin-OCR
2026-03-11 · arxiv
OCR
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
2026-03-11 · arxiv
OCR
GLM-OCR Technical Report
2026-03-11 · arxiv
OCR
DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding
2026-03-08 · arxiv
OCR
FireRed-OCR Technical Report
2026-03-02 · arxiv
OCR
PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust Document Parsing
2026-01-29 · arxiv
OCR
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
2026-04-09 · arxiv
Efficient
ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
2026-04-07 · arxiv
Efficient
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
2026-03-19 · arxiv
Efficient
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
2026-01-15 · arxiv
Efficient
MiMo-V2-Flash Technical Report
2026-01-06 · arxiv
Efficient
Dead Weights, Live Signals: Feedforward Graphs of Frozen Language Models
2026-04-09 · arxiv
FrontierModel CombinationSmall Model
Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents
2026-04-08 · arxiv
FrontierAgentReasoning
Multi-objective Evolutionary Merging Enables Efficient Reasoning Models
2026-04-07 · arxiv
FrontierReasoningModel Merging
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
2026-04-06 · arxiv
FrontierReasoningSearch
Phi-4-reasoning-vision-15B Technical Report
2026-03-04 · arxiv
FrontierNew ModelVLMSmall Model
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
2026-04-09 · arxiv
ReasoningSmall ModelsModel Release
Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution
2026-04-09 · arxiv
Reasoning
Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning
2026-04-02 · arxiv
Reasoning
ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence
2026-03-24 · arxiv
Reasoning
Vero: An Open RL Recipe for General Visual Reasoning
2026-04-06 · arxiv
VLM
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
2026-03-06 · arxiv
VLM
STEP3-VL-10B Technical Report
2026-01-14 · arxiv
VLM
KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
2026-04-09 · arxiv
Browser AgentBenchmarkMobile
Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction
2026-04-07 · arxiv
Browser AgentGuiModel Release
Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
2026-04-09 · arxiv
DistillationSmall Beats BigOn Policy DistillationMath Reasoning
Cross-Tokenizer LLM Distillation through a Byte-Level Interface
2026-04-08 · arxiv
DistillationSmall Beats BigCross TokenizerByte Level
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
2026-04-06 · arxiv
Small VLMMultimodalEfficient
Empirical Recipes for Efficient and Compact Vision-Language Models
2026-03-17 · arxiv
Small VLMMultimodalEfficient
Test Time Compute
2 papers
TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis
2026-04-09 · arxiv
Test Time ComputeRlvrSmall Model
SeLaR: Selective Latent Reasoning in Large Language Models
2026-04-09 · arxiv
Test Time ComputeLatent ReasoningSmall Model
MARS: Enabling Autoregressive Models Multi-Token Generation
2026-04-09 · arxiv
AutoregressiveMulti TokenEfficiencyMathCode
FLUX: Data Worth Training On
2026-03-14 · arxiv
Data CurationSmall Beats BigEfficient TrainingPretraining
DMax: Aggressive Parallel Decoding for dLLMs
2026-04-10 · arxiv
Diffusion LLMParallel DecodingEfficiencyMathCode
JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency
2026-04-03 · arxiv
Model ReleaseReasoningCodingSmall Models
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
2026-04-09 · arxiv
MOEMultimodalRouting
OmniDocBench Leaderboard Update (2026/03/31)
2026-03-31 · arxiv
OCR Document
SliderQuant: Accurate Post-Training Quantization for LLMs
2026-03-26 · arxiv
QuantizationSmall Beats BigModel CompressionEfficient Inference
Self-Distilled RLVR
2026-04-06 · arxiv
RlvrSelf DistillationPost TrainingMultimodal Reasoning
Claude Mythos Preview System Card
2026-04-07 · arxiv
Safety Evaluation
Gemma 4, Phi-4, and Qwen3: Accuracy-Efficiency Tradeoffs in Dense and MoE Reasoning Language Models
2026-04-08 · arxiv
Small ModelsReasoning
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
2026-04-09 · arxiv
Tool UseSmall ModelMath Reasoning
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
2026-04-09 · arxiv
Vision Language