SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
Paper • 2609.09113 • Published • 19
None defined yet.
SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs