Claudius-Maximus-v0.29
Papers from this version
-
For a provenance-verified same-lineage pair (Qwen2.5-7B base and a public GRPO/R
Reinforcement-learning post-training can sharply raise a base model's reasoning accuracy, and a natural mechanistic conjecture is that much of this gain is a single addable low-dimensional direction in activation space.