Het beste AI-model bestaat niet. Wel het beste model voor jouw toepassing

Waarom werken met ons:

– we verbeteren je bereikbaarheid
– we verhogen je klantbeleving
– we vergroten je efficiency

Weten hoe we AI al jaren inzetten voor klantbeleving?

“Met Pegamento hebben we niet alleen een leverancier, maar een echte partner in verandering gevonden. Dankzij hun expertise en onze gezamenlijke DevOps-aanpak hebben we in korte tijd grote stappen gezet. De technologie ondersteunt onze mensen, zodat zij zich kunnen richten op waar ze het verschil maken: persoonlijk contact met ondernemers.”

Bij iedere introductie van een nieuw taalmodel gebeurt ongeveer hetzelfde. Binnen de kortste keren verschijnen benchmarks, ranglijsten en vergelijkingen. Het ene model is beter in redeneren, het andere scoort hoger op programmeren, een derde is goedkoper of sneller. En vervolgens ontstaat de bijna onvermijdelijke discussie: welk AI-model is nu eigenlijk het beste?

Het is een begrijpelijke vraag. Maar voor organisaties waarschijnlijk niet de belangrijkste. Want zelfs als een model bovenaan een benchmark staat, betekent dat nog niet dat het ook de beste keuze is voor jouw klantcontact, processen of medewerkers. Daarvoor moet je iets anders meten.

Wat vertelt een benchmark eigenlijk?

Benchmarks zijn zeker niet waardeloos. Ze maken het mogelijk om modellen onder vergelijkbare omstandigheden te testen en geven inzicht in hun sterke en zwakke punten. Maar een benchmark meet altijd iets specifieks: een bepaalde taak, een bepaalde dataset en een bepaalde manier van testen.

Daarom waarschuwt Gartner in het onderzoek How to Avoid Being Misled (Fooled) by AI Benchmarks uit augustus 2026 voor het te gemakkelijk interpreteren van benchmarkresultaten. Zonder goed te begrijpen wat een test precies meet, kunnen organisaties op basis van zo’n ranglijst uiteindelijk zelfs het verkeerde model kiezen.

Dat is een belangrijk onderscheid. Een benchmarkscore kan prima kloppen, terwijl de conclusie “dit is dus het beste model voor ons” alsnog verkeerd is.

Klantcontact is geen laboratoriumtest

Dat wordt duidelijk zodra je naar een praktijkvoorbeeld kijkt. Een taalmodel kan uitstekend presteren op complexe redeneervragen, maar stel dat een klant zegt: “Ik heb vorige week al iemand gesproken. Toen zou mijn aanvraag worden aangepast, maar volgens mij is er nog niets gebeurd.”

Voor een goed antwoord is veel meer nodig dan algemene intelligentie. Wat is er vorige week besproken? Welke klantgegevens zijn relevant? Wat is de huidige status? Welke afspraken zijn gemaakt? Welke procedures gelden? Zijn er uitzonderingen? Mag AI dit zelfstandig oplossen of moet een medewerker het gesprek overnemen?

En vervolgens moet het antwoord ook nog passen bij de klant, de organisatie en het kanaal. Dat soort situaties vind je nauwelijks terug in algemene benchmarkranglijsten, terwijl dát juist de situaties zijn waarin organisaties AI willen inzetten.

Iedere organisatie heeft zijn eigen werkelijkheid

Daar komt bij dat geen twee organisaties precies hetzelfde zijn. Ze hebben hun eigen producten, processen, systemen en uitzonderingen. Maar ook hun eigen woorden en afkortingen. Een term die binnen een organisatie volkomen logisch is, kan buiten die organisatie iets heel anders betekenen.

Een taalmodel kan dus beschikken over enorme hoeveelheden algemene kennis en toch moeite hebben met informatie die voor medewerkers vanzelfsprekend is. Dat betekent niet automatisch dat er voor iedere organisatie een apart gespecialiseerd taalmodel nodig is. Het betekent vooral dat de context waarin het model wordt gebruikt minstens zo belangrijk is als het model zelf.

Kan het model beschikken over actuele kennis? Begrijpt het de terminologie? Heeft het toegang tot de juiste klantinformatie? Kent het de bedrijfsregels? En weet het wanneer het iets niet weet? Dat bepaalt uiteindelijk voor een groot deel de kwaliteit.

Een LLM is maar één onderdeel van de oplossing

Daarom zouden organisaties niet alleen taalmodellen met elkaar moeten vergelijken. Ze zouden complete AI-oplossingen moeten vergelijken.

In klantcontact kan zo’n keten er bijvoorbeeld als volgt uitzien: klantvraag → klantcontext → bedrijfskennis → procesregels → AI-model → controles → antwoord.

Het LLM speelt daarin een belangrijke rol, maar het is niet het enige onderdeel. Een model dat in een openbare benchmark iets lager eindigt, maar wel over de juiste actuele informatie beschikt en goed geïntegreerd is met de processen van de organisatie, kan in de praktijk veel beter presteren.

Omgekeerd kun je het krachtigste model ter wereld inzetten, maar als het werkt met slechte of ontbrekende informatie zal ook dat model fouten maken. De relevante vergelijking wordt daardoor breder. Niet alleen: welk model gebruiken we? Maar ook: hoe bouwen we de toepassing daaromheen?

Hetzelfde geldt voor kosten

Ook prijsvergelijkingen tussen modellen zijn minder eenvoudig dan ze lijken. Een model kan bijvoorbeeld iets duurder zijn per aanroep, maar minder vaak fouten maken. Een ander model is goedkoper, maar heeft vaker extra stappen nodig, menselijke controle of meerdere modelaanroepen om hetzelfde resultaat te bereiken.

Voor een organisatie is daarom niet alleen de prijs van het model interessant. Veel relevanter is: wat kost een succesvolle afhandeling uiteindelijk? Daar horen ook integraties, beheer, monitoring, herstel van fouten en menselijke tussenkomst bij.

Zeker wanneer AI op grote schaal wordt ingezet, kunnen kleine verschillen per interactie uiteindelijk grote financiële gevolgen hebben.

Ook snelheid heeft alleen betekenis in de juiste context

Hetzelfde probleem zie je bij snelheid. Model A reageert in twee seconden. Model B heeft zes seconden nodig. Is A dan beter? Misschien.

In een live klantgesprek kan vier seconden verschil behoorlijk relevant zijn. Maar bij een proces waarbij ’s nachts duizenden documenten of e-mails worden verwerkt, maakt het misschien vrijwel niets uit.

Ook hier geldt dus: een score krijgt pas betekenis wanneer je hem koppelt aan een concrete toepassing.

Governance hoort ook in de vergelijking thuis

Voor organisaties zijn daarnaast onderwerpen belangrijk die in openbare modelranglijsten nauwelijks zichtbaar zijn. Waar worden gegevens verwerkt? Wat gebeurt er met prompts? Welke informatie mag het model zien? Hoe worden antwoorden gecontroleerd? Kun je achterhalen welke bronnen zijn gebruikt? Wat gebeurt er wanneer het model twijfelt? Wanneer moet een medewerker de controle overnemen? Hoe voorkom je dat AI iets toezegt wat volgens het proces helemaal niet mag?

Voor organisaties in bijvoorbeeld zorg, overheid, financiële dienstverlening of andere gereguleerde omgevingen kunnen dergelijke vragen zelfs zwaarder wegen dan een paar procentpunten verschil in een benchmark.

De belangrijkste benchmark moet je zelf maken

Wil je werkelijk weten welke AI-oplossing goed werkt, dan moet je uiteindelijk testen met situaties uit je eigen organisatie. Neem bijvoorbeeld een representatieve set klantvragen en scenario’s. Niet alleen de eenvoudige gevallen, maar juist ook situaties waarin het ingewikkeld wordt.

Wat gebeurt er als een klant meerdere vragen tegelijkertijd stelt? Wat als een interne term verkeerd wordt gebruikt? Wat als belangrijke informatie ontbreekt? Wat als twee kennisbronnen elkaar lijken tegen te spreken? Wat als er een uitzondering geldt op de normale procedure? En wat als de klant iets vraagt waar AI niet zelfstandig over mag beslissen?

Hoe de oplossing zich in dat soort situaties gedraagt, zegt veel meer over de praktische bruikbaarheid dan een algemene benchmarkscore.

Meet wat er voor jouw organisatie toe doet

Vervolgens kun je verschillende oplossingen beoordelen op criteria die daadwerkelijk relevant zijn. Denk aan inhoudelijke juistheid, het aantal hallucinaties, aansluiting op de beschikbare kennis, naleving van processen, snelheid, kosten en beveiliging.

Maar ook aan iets wat in technische benchmarks gemakkelijk wordt vergeten: de kwaliteit van de interactie. Past het antwoord bij de klant? Is de toon goed? Wordt een ingewikkelde vraag begrijpelijk uitgelegd? Herkent het systeem wanneer een medewerker nodig is?

De beste AI-oplossing is uiteindelijk niet degene met de hoogste algemene intelligentiescore. Het is degene die binnen jouw omgeving het gewenste resultaat oplevert.

Wachten op de winnaar heeft weinig zin

Er zit nog een risico aan de voortdurende discussie over welk model het beste is. Organisaties kunnen erdoor gaan wachten. Nog even niet beginnen, want over drie maanden komt waarschijnlijk weer een beter model.

En dat klopt waarschijnlijk ook. Er komt over drie maanden weer iets nieuws. Daarna ook.

De ontwikkeling gaat simpelweg te snel om te wachten op het moment waarop één model definitief als winnaar kan worden aangewezen. Dat moment komt waarschijnlijk helemaal niet.

Veel belangrijker is daarom dat organisaties nu ervaring gaan opdoen. Niet door meteen alles met AI te automatiseren, maar door gericht toepassingen te kiezen en te meten wat er gebeurt.

Waar werkt het goed? Waar loopt het mis? Welke kennis ontbreekt? Welke processen moeten worden aangepast? Wanneer is menselijke tussenkomst nodig? En waar ontstaat aantoonbare waarde voor klant, medewerker en organisatie?

Die kennis bouw je alleen op door AI daadwerkelijk in je eigen omgeving te testen.

Test vandaag, vergelijk morgen opnieuw

Dat heeft nog een voordeel. Wanneer je eenmaal een eigen testset hebt opgebouwd, wordt het veel eenvoudiger om nieuwe modellen te beoordelen.

Komt er volgende maand een nieuw taalmodel beschikbaar? Dan hoef je niet af te gaan op de enthousiaste posts en ranglijsten die binnen een paar uur verschijnen. Je kunt het gewoon zelf testen met dezelfde klantvragen, dezelfde processen, dezelfde kennis en dezelfde eisen.

Vervolgens kijk je of het nieuwe model daadwerkelijk betere resultaten oplevert. Zo verandert modelselectie van een discussie over technologie in een continu verbeterproces.

Dus: welk model is het beste?

Misschien is dat uiteindelijk gewoon de verkeerde vraag.

Algemene benchmarks blijven nuttig. Ze maken ontwikkelingen inzichtelijk en helpen bij een eerste selectie van interessante modellen. Maar de werkelijke test begint daarna.

Met jouw data, jouw kennis, jouw processen, jouw beveiligingseisen, jouw klanten, jouw medewerkers en jouw doelstellingen.

Daarom is het verstandiger om niet te wachten tot de markt heeft bepaald welk LLM de winnaar is. Stop met zoeken naar het perfecte model en begin met onderzoeken welke AI-oplossing in jouw organisatie waarde oplevert.

Misschien blijkt daarbij dat het model dat op een openbare ranglijst derde staat, voor jouw toepassing gewoon de beste keuze is. En misschien verandert dat over een paar maanden weer.

Prima. Als je maar kunt meten waarom.

Van modelkeuze naar werkende AI

Bij Pegamento kijken we daarom verder dan het selecteren van een taalmodel alleen. De waarde ontstaat uit de combinatie van AI, bedrijfsdata, kennis, context, governance, integraties, processen en menselijke expertise.

Binnen WorkplaceX brengen we die onderdelen samen en maken we het mogelijk om AI gecontroleerd toe te passen in het dagelijkse klantcontact en andere bedrijfsprocessen.

Niet door te wachten op het perfecte model, maar door te beginnen, te meten, te leren en waar nodig opnieuw te kiezen.

Want uiteindelijk telt niet welk model wereldwijd bovenaan staat.

Het gaat erom wat binnen jouw organisatie daadwerkelijk werkt.

Meer blogs

Heb je een vraag?

We helpen je graag verder.
Plan een 15 minuten kennismaking
of bel +31 (0)88 00 67 180

Download hier de whitepaper

Verdiep je kennis met de whitepapers van Pegamento.