{"id":88569,"date":"2026-06-22T10:14:12","date_gmt":"2026-06-22T10:14:12","guid":{"rendered":"https:\/\/www.europesays.com\/be-nl\/88569\/"},"modified":"2026-06-22T10:14:12","modified_gmt":"2026-06-22T10:14:12","slug":"arbor-laat-ai-agents-leren-van-hun-eigen-fouten","status":"publish","type":"post","link":"https:\/\/www.europesays.com\/be-nl\/88569\/","title":{"rendered":"Arbor laat AI-agents leren van hun eigen fouten"},"content":{"rendered":"<p class=\"wp-block-paragraph\">Onderzoekers van Microsoft Research en de Renmin University of China presenteren een nieuw framework dat AI-agents beter moet maken in het optimaliseren van software en <a href=\"https:\/\/www.techzine.nl\/nieuws\/infrastructure\/579321\/ai-agents-nemen-robottraining-over-bij-nvidia\/\" rel=\"nofollow noopener\" target=\"_blank\">machine learning-systemen<\/a>. Volgens hun onderzoek presteert Arbor daarbij aanzienlijk beter dan bestaande oplossingen zoals Claude Code en Codex.<\/p>\n<p class=\"wp-block-paragraph\">Het project richt zich volgens <a href=\"https:\/\/venturebeat.com\/orchestration\/new-ai-optimization-framework-beats-claude-code-and-codex-by-2-5x-on-the-same-compute-budget\" target=\"_blank\" rel=\"nofollow noopener\">VentureBeat<\/a> op een bekend probleem. AI-systemen die tijdens ontwikkeling goed functioneren, blijken in productie soms verkeerde antwoorden te geven of belangrijke randvoorwaarden te missen. Het verbeteren van zulke systemen verloopt vaak via een reeks aanpassingen aan prompts, zoekmethoden en andere instellingen, waardoor lastig is vast te stellen welke wijziging werkelijk effect heeft.<\/p>\n<p class=\"wp-block-paragraph\">Volgens de onderzoekers ontbreekt het bestaande coding agents niet aan rekenkracht, maar aan een manier om ervaringen uit eerdere experimenten vast te houden en opnieuw te gebruiken. Daardoor dreigen ze dezelfde fouten te herhalen.<\/p>\n<p class=\"wp-block-paragraph\">Arbor kiest daarom voor een andere architectuur. Een centrale co\u00f6rdinator bepaalt de onderzoeksrichting en beoordeelt resultaten, terwijl afzonderlijke agents experimenten uitvoeren in ge\u00efsoleerde omgevingen. Zo kunnen meerdere oplossingsrichtingen parallel worden getest zonder elkaar te be\u00efnvloeden.<\/p>\n<p>Kennisboom als geheugen<\/p>\n<p class=\"wp-block-paragraph\">De basis van Arbor is een zogenoemde Hypothesis Tree Refinement-structuur. Hypotheses, experimenten, resultaten en conclusies worden opgeslagen in een boomstructuur die tijdens het optimalisatieproces groeit.<\/p>\n<p class=\"wp-block-paragraph\">Mislukte experimenten verdwijnen niet uit beeld, maar worden vastgelegd als kennis. Daardoor voorkomt het systeem dat dezelfde fout later opnieuw wordt gemaakt. Succesvolle resultaten kunnen juist worden vertaald naar bredere inzichten die nieuwe experimenten sturen.<\/p>\n<p class=\"wp-block-paragraph\">Als voorbeeld noemen de onderzoekers een RAG-omgeving. Waar traditionele agents vaak meerdere onderdelen tegelijk aanpassen, behandelt Arbor elke wijziging als een afzonderlijke hypothese. Daardoor wordt beter zichtbaar welke verandering daadwerkelijk bijdraagt aan betere prestaties.<\/p>\n<p>Beter dan Claude Code en Codex<\/p>\n<p class=\"wp-block-paragraph\">Voor de tests gebruikten de onderzoekers onder meer GPT-5.5, Claude Opus 4.6 en Gemini-3-Flash als onderliggende modellen. Arbor werd vervolgens vergeleken met Claude Code en Codex onder dezelfde budget- en rekenvoorwaarden.<\/p>\n<p class=\"wp-block-paragraph\">Volgens de resultaten realiseerde Arbor gemiddeld meer dan 2,5 keer zoveel prestatieverbetering als de concurrerende systemen. In een benchmark rond zoekoptimalisatie steeg de nauwkeurigheid van 45,3 naar 67,7 procent. Claude Code en Codex bleven steken op respectievelijk 53,3 en 50 procent.<\/p>\n<p class=\"wp-block-paragraph\">Daarnaast bleek Arbor minder gevoelig voor overfitting. Verbeteringen die tijdens ontwikkeling werden gevonden, bleven beter overeind op onafhankelijke testdata.<\/p>\n<p class=\"wp-block-paragraph\">De onderzoekers zien vooral toepassingen in langdurige optimalisatietrajecten, zoals AI-pijplijnen, modeltraining en datasynthese. Daar staat tegenover dat de aanpak relatief veel tokens, opslag en rekenkracht vraagt.<\/p>\n<p class=\"wp-block-paragraph\">Ook blijft de kwaliteit van de uitkomsten afhankelijk van de gebruikte evaluatiemethode. Een gebrekkige metric leidt volgens de onderzoekers vooral tot sneller optimaliseren in de verkeerde richting.<\/p>\n","protected":false},"excerpt":{"rendered":"Onderzoekers van Microsoft Research en de Renmin University of China presenteren een nieuw framework dat AI-agents beter moet&hellip;\n","protected":false},"author":2,"featured_media":88570,"comment_status":"","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","_share_on_mastodon":"0"},"categories":[38],"tags":[3657,20568,27,26,25,9744,801,638,39,41,42,46,40,45,43,44],"class_list":["post-88569","post","type-post","status-publish","format-standard","has-post-thumbnail","category-wetenschap-en-technologie","tag-ai-agents","tag-arbor","tag-be","tag-belgie","tag-belgium","tag-claude-code","tag-codex","tag-microsoft","tag-science","tag-science-and-technology","tag-scienceandtechnology","tag-technologie","tag-technology","tag-wetenschap","tag-wetenschap-en-technologie","tag-wetenschaptechnologie"],"share_on_mastodon":{"url":"https:\/\/pubeurope.com\/@be_nl\/116793236860911725","error":""},"_links":{"self":[{"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/posts\/88569","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/comments?post=88569"}],"version-history":[{"count":0,"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/posts\/88569\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/media\/88570"}],"wp:attachment":[{"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/media?parent=88569"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/categories?post=88569"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.europesays.com\/be-nl\/wp-json\/wp\/v2\/tags?post=88569"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}