Nvidia bewijst: de harness, niet het model, is nu de held#
AI-agentsClaude & AnthropicAI-tools voor developers
Nvidia publiceerde onderzoek waarin een custom harness — de scaffolding rond het model: geheugen, context, feedback en een superviserende agent — Claude Opus 5 van 30% naar 100% tilde op een lang-horizont-taak. Hun coding-agent AVO scoorde daarnaast 100% op de publieke set van ARC-AGI-3 (alle 183 levels), zonder instructies of expliciete doelen. De kernboodschap: voor lange agentische taken is modelkeuze een kleiner deel dan veel mensen denken; de orchestratie eromheen bepaalt of een agent van de rails loopt.