AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling Paper • 2608.26623 • Published 24 days ago • 20
Safin-1: Safety from Within through Memory-Native State Evolution Paper • 2609.00092 • Published 20 days ago • 21
DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory Paper • 2609.00768 • Published 19 days ago • 23
Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System Paper • 2609.01607 • Published 19 days ago • 24
Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement Paper • 2609.01481 • Published 19 days ago • 19
Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching Paper • 2609.01404 • Published 19 days ago • 28
From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix Paper • 2609.01572 • Published 19 days ago • 36
Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering Paper • 2608.30468 • Published 20 days ago • 36
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers Paper • 2609.01343 • Published 19 days ago • 89
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving Paper • 2609.00111 • Published 20 days ago • 311
Uncertainty-Aware End-to-End AI Weather Forecasting: Disentangling Observation and Model Contributions Paper • 2608.30795 • Published 20 days ago • 3
Dynamic Important Example Mining for Reinforcement Finetuning Paper • 2608.29252 • Published 22 days ago • 5
Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models Paper • 2608.29137 • Published 22 days ago • 5
MMMMM: A Unified Taxonomy for Investigating the Mechanisms of Multilingual MultiModal Misinformation Paper • 2608.29681 • Published 21 days ago • 3
SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models Paper • 2608.29974 • Published 21 days ago • 4
EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants Paper • 2608.29387 • Published 22 days ago • 7
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions Paper • 2608.28958 • Published 22 days ago • 7
Cross-lingual Functional Vectors for Emotion Detection in Large Language Models Paper • 2608.29613 • Published 21 days ago • 5