Algorithm Deep-Dive: RMM — TopK Column-Norm Slicing: Formulas, 1B–70B Results, and the Attention/MLP Asymmetry
RMM full breakdown: contraction-dim TopK column-norm selection, minimax optimality proof, retention-ratio knob; 8 benchmarks × 4 retention levels, attention vs MLP asymmetry data, A100 end-to-end 1.40× speedup.