Intern-S2-Preview: Scientific Agentic Foundation Model Paper • 2608.13505 • Published 7 days ago • 66
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development Paper • 2608.13417 • Published 7 days ago • 50
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains Paper • 2608.09873 • Published 10 days ago • 29
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published 21 days ago • 72
UEmbed: Unified Sparse and Dense Multimodal Embeddings Paper • 2608.02583 • Published 17 days ago • 50
Metacognition in LLMs: Foundations, Progress, and Opportunities Paper • 2607.11881 • Published Jul 13 • 30
Dockerless: Environment-Free Program Verifier for Coding Agents Paper • 2606.28436 • Published Jun 26 • 116