Training door Tarik Eraslan App Tarik

Een AI-systeem onderhouden: wat komt er na de bouw?

In het kort

Na de bouw heeft een AI-systeem onderhoud nodig. Je legt vast wat goed werk is, test met een vaste set voorbeelden en draait die test na elke wijziging. Modellen worden vervangen: Anthropic geeft voor publiek uitgebrachte modellen minstens 60 dagen vooraf bericht voordat een model stopt (stand oktober 2026). Daarnaast werk je de instructies bij en houd je bij wat het systeem doet.

Waarom een AI-systeem onderhoud nodig heeft

Een AI-systeem dat vandaag goed werkt, kan over drie maanden slechter presteren. Je klanten stellen nieuwe vragen. Ook het model onder je systeem wordt na verloop van tijd vervangen. Onderhoud zorgt dat je dat op tijd merkt.

Anthropic schrijft in Building effective agents (19 december 2024) dat meten en blijven verbeteren de sleutel is bij elke toepassing met taalmodellen. Dat geldt ook na de bouw. Hieronder lees je wat je concreet doet.

Leg vast wat goed werk is

Je kunt pas testen als je weet waar je op test. In de documentatie Define success criteria and build evaluations noemt Anthropic vier eigenschappen van goede succescriteria:

  • Specifiek: beschrijf precies wat je wilt bereiken.
  • Meetbaar: gebruik getallen of een duidelijke schaal.
  • Haalbaar: baseer je doel op wat het model realistisch kan.
  • Relevant: sluit aan bij het doel van je toepassing en wat je gebruikers nodig hebben.

Voor een systeem dat offerteaanvragen sorteert, kan een criterium zijn: op een vaste set van vijftig aanvragen komen er minstens 45 in de juiste categorie. Volgens Anthropic hebben de meeste toepassingen meerdere criteria nodig, bijvoorbeeld ook voor toon, privacy, snelheid of kosten.

Bouw een vaste testset met voorbeelden

Een testset is een lijst met voorbeeldinvoer, met daarbij het antwoord dat je verwacht. In de AI-wereld heet dat een eval. Anthropic geeft drie adviezen voor het opzetten ervan:

  1. Maak de test taakgericht. De voorbeelden moeten lijken op wat het systeem in het echt binnenkrijgt. Vergeet de randgevallen niet.
  2. Automatiseer waar het kan. Stel de test zo op dat een computer de uitkomst kan beoordelen.
  3. Kies voor volume. Volgens Anthropic zijn meer testvragen met iets minder precieze automatische beoordeling beter dan een paar vragen die je met de hand beoordeelt.

Begin met echte gevallen uit de eerste weken van gebruik. Haal persoonsgegevens eruit voordat je ze in je testset opneemt. Elke keer dat het systeem in het echt iets fout doet, voeg je dat geval toe. Zo groeit je testset mee met wat er in de praktijk gebeurt.

Hoe beoordeel je de uitkomsten?

Anthropic beschrijft drie manieren om testuitkomsten te beoordelen, met als advies de snelste en meest betrouwbare te kiezen die past.

MethodeWanneerLet op
Beoordeling met codeAls het antwoord exact te controleren is, zoals een categorie of een bedragSnel en betrouwbaar, minder geschikt voor nuance
Beoordeling door een taalmodelBij open antwoorden, zoals de toon van een mailWerkt met een duidelijke beoordelingsregel. Test eerst of de beoordeling klopt.
Beoordeling door een mensBij twijfelgevallenFlexibel en goed, maar traag. Anthropic raadt aan dit waar mogelijk te vermijden.

Vang modelupdates op

Het model onder je systeem blijft niet eeuwig beschikbaar. Op de pagina Model deprecations beschrijft Anthropic vier fases: active, legacy, deprecated en retired. Een model met de status deprecated werkt nog, met een vastgestelde einddatum. Na die datum mislukken verzoeken aan het model.

Anthropic stuurt klanten met actief gebruik van een model minstens 60 dagen vooraf bericht voordat een publiek uitgebracht model stopt. Het advies is om je toepassing ruim voor de einddatum met een nieuwer model te testen.

Hier betaalt je testset zich terug. Je draait dezelfde test op het nieuwe model en ziet direct of de uitkomsten gelijk blijven. Lees ook de berichten van je leverancier en zet de datum van een aangekondigde uitfasering in je agenda.

Werk je instructies bij

Je instructies, ook wel prompts genoemd, zijn het deel dat je het vaakst aanpast. Komt er een nieuwe dienst bij of zie je een fout steeds terugkomen, dan werk je ze bij.

Verander één ding tegelijk en draai daarna je testset. Zo zie je of de wijziging helpt en of er niets anders stukgaat. Bewaar oude versies van je instructies met een datum, zodat je kunt terugkeren als een wijziging slecht uitpakt.

Houd bij wat het systeem doet

Logging betekent dat je vastlegt wat het systeem binnenkreeg, wat het deed en wat het opleverde. Anthropic noemt transparantie als een van zijn drie principes bij agents: laat expliciet zien welke stappen de agent plant.

Met een log kun je achteraf zien waarom iets misging. Het levert ook de voorbeelden voor je testset. Leg wel vast hoe lang je logs bewaart en wie erbij kan, want er staan vaak persoonsgegevens in.

Een eenvoudig onderhoudsritme

  • Wekelijks: een steekproef uit de log bekijken en fouten toevoegen aan je testset.
  • Bij elke wijziging: de testset draaien voordat je de nieuwe versie gebruikt.
  • Bij een aangekondigde uitfasering: het nieuwe model testen ruim voor de einddatum.
  • Elk kwartaal: de succescriteria naast je bedrijfsdoelen leggen en waar nodig aanpassen.

Onderhoud meenemen in de bouw

Onderhoud is makkelijker als je er tijdens de bouw al rekening mee houdt. Leg je testset en je log aan vanaf de eerste versie. Dat is een van de dingen die je in een bouwweek voor je eigen AI-systeem samen opzet. Hoe die week eruitziet, lees je in je eigen AI-systeem bouwen in één week. Twijfel je of je het onderhoud zelf wilt doen, lees dan AI zelf bouwen of laten bouwen.

Veelgestelde vragen

Wat is een eval?

Een eval is een vaste test met voorbeeldinvoer en het antwoord dat je verwacht. Je draait hem na elke wijziging om te zien of je systeem nog goed werkt.

Hoe lang van tevoren hoor ik dat een model stopt?

Anthropic geeft klanten met actief gebruik minstens 60 dagen vooraf bericht voordat een publiek uitgebracht model stopt (stand oktober 2026).

Hoe vaak moet ik mijn AI-systeem testen?

Na elke wijziging aan instructies of model, en daarnaast regelmatig met een steekproef uit je log.

Plan je training via WhatsApp