FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience Paper • 2609.03241 • Published 7 days ago • 89
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation Paper • 2609.05295 • Published 6 days ago • 12
LatentPress: Context Compression Beyond Text and Vision Paper • 2609.01507 • Published 9 days ago • 117
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 7 days ago • 176
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 7 days ago • 176
Influence-Directed Distillation: Solving the Diversity Bottleneck in Sampled-Token On-Policy Distillation Paper • 2608.29846 • Published 11 days ago • 16
It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning Paper • 2609.00638 • Published 9 days ago • 72
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement Paper • 2608.31046 • Published 10 days ago • 149
J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data Paper • 2608.26582 • Published 14 days ago • 45
EnvHarness: Awakening Static Worlds for Agent Learning Paper • 2608.19880 • Published 21 days ago • 275
EnvHarness: Awakening Static Worlds for Agent Learning Paper • 2608.19880 • Published 21 days ago • 275 • 2
EnvHarness: Awakening Static Worlds for Agent Learning Paper • 2608.19880 • Published 21 days ago • 275
SPADE: Self-Play in Adaptive Synthetic Executable Environments Paper • 2608.19197 • Published 22 days ago • 52
SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning Paper • 2608.14277 • Published 27 days ago • 35