Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge Paper • 2609.34327 • Published 2 days ago • 32
Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning Paper • 2609.33781 • Published 3 days ago • 28
Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning Paper • 2609.33781 • Published 3 days ago • 28
Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge Paper • 2609.34327 • Published 2 days ago • 32
Sangsang/ThinkSafe-DeepSeek-R1-Distill-Llama-8B-Activation-LoRA Text Generation • Updated 9 days ago • 39
Sangsang/ThinkSafe-DeepSeek-R1-Distill-Llama-8B-Activation-LoRA Text Generation • Updated 9 days ago • 39
Sangsang/ThinkSafe-DeepSeek-R1-Distill-Llama-8B-Activation-data Viewer • Updated 9 days ago • 38.5k • 35
Sangsang/ThinkSafe-DeepSeek-R1-Distill-Llama-8B-Activation-data Viewer • Updated 9 days ago • 38.5k • 35