AI- en LLM-pentest laten uitvoeren
Steeds meer toepassingen laten een taalmodel meebeslissen: een chatbot die klantgegevens opzoekt, een agent die facturen inboekt, een assistent die uw documentatie doorzoekt. Daarmee verschuift het aanvalsoppervlak. Een AI-pentest laat zien of uw integratie bestand is tegen prompt injection, jailbreaks, gegevens die via het model naar buiten lekken en agents die meer mogen dan de gebruiker die ze aanstuurt.
Wij testen volgens OWASP Top 10 for LLM en met aanvalsscenario's die wij in de praktijk hebben zien werken. Een LLM-pentest beslaat het model zelf, de RAG-pipeline, de AI-agents en de tools die zij mogen aanroepen, de API's eromheen en de rest van de integratieomgeving: identiteit, autorisatielogica en de maatregelen die het geheel moeten begrenzen.

Zij vertrouwen op ons
Wat is een AI- en LLM-pentest en waarom is die nodig?
Een taalmodel behandelt instructies en gegevens als één en dezelfde stroom tekst. Wie tekst in die stroom krijgt, via een geüpload document, een e-mail die de agent leest of een pagina in de RAG-index, stuurt daarmee het gedrag van het model. Dat is de kern van prompt injection, en geen enkele scanner van webapplicaties vindt het. Hetzelfde geldt voor een agent die technisch gezien bij alle klantdossiers kan terwijl de gebruiker erachter maar bij één dossier hoort te kunnen.
Wij toetsen dat handmatig, in uw eigen omgeving en met uw eigen data. U krijgt geen lijst met theoretische risico's, maar bevindingen op volgorde van herstel: wat gerepareerd moet worden voordat de integratie live gaat en wat kan wachten tot de volgende release.
Ervaring
Wij testen AI-integraties zoals ze in productie draaien, met de koppelingen en de data die er echt in zitten. Elke bevinding komt met een reproduceerbaar bewijs; wat wij niet aan de praat krijgen, haalt het rapport niet.
Transparantie
Scope, testaccounts en de grenzen van wat wij mogen proberen leggen wij vooraf schriftelijk vast. Vindt een tester iets kritieks, dan hoort u dat dezelfde dag en niet pas bij de oplevering.
Samenwerking
Wij werken rechtstreeks met de ontwikkelaars die de integratie hebben gebouwd. Het rapport is zo geschreven dat een aanpassing in de systeemprompt, de tooldefinitie of de autorisatielaag meteen te maken is.
Professionaliteit
Wij testen uitsluitend op basis van schriftelijke toestemming en binnen de afgesproken scope. Prompts, documenten en modeluitvoer die wij onderweg zien, blijven vertrouwelijk, ook na afloop van de opdracht.
Testproces
Hoe verloopt een AI- en LLM-pentest?
Wij beginnen met dreigingsmodellering op de architectuur en toetsen daarna met de hand wat een aanvaller er werkelijk mee bereikt. OWASP Top 10 for LLM is daarbij de leidraad, niet de afvinklijst.
Adviesgesprek en scope
Wij brengen de architectuur in kaart: welk model, welke data eromheen, welke tools de agent mag aanroepen en waar de integratie raakt aan systemen die er niet bij horen.
Prompts, API's en integratie testen
Wij toetsen de invoer aan alle kanten, de autorisatie achter elke tool en de guardrails die het gedrag van het model moeten begrenzen.
Aanvalsscenario's naspelen
Directe en indirecte prompt injection, jailbreaks, het uitlekken van de systeemprompt en van gegevens uit de RAG-index, en misbruik van de tools die de agent mag aanroepen.
Rapport, aanbevelingen en hertest
U krijgt de bevindingen met bewijs en per bevinding een concrete herstelstap. Na het herstel voeren wij een hertest uit en leggen wij vast welke risico's daadwerkelijk weg zijn.
Scope
Wat testen wij in AI- en LLM-integraties?
De dekking loopt van het model tot de logging: de data die erin gaat, de tools die eruit worden aangeroepen en alles wat daartussen zou moeten begrenzen.
LLM-integraties
OpenAI en Azure OpenAI, Anthropic, Google Vertex AI, Mistral en modellen die u zelf host. Wij testen uw integratie, niet het model van de leverancier.
RAG-pipeline
Het inlezen en indexeren van documenten, de retrieval en de vectordatabase. Wie de index kan vullen, stuurt het antwoord: daar kijken wij als eerste, samen met de vraag of de index documenten teruggeeft die de vragensteller niet mag zien.
AI-agents en tools
Tool use en function calling, plug-ins en de orkestratie van meerstapsopdrachten. De vraag is steeds of de agent iets kan doen wat de gebruiker erachter niet mag.
API's en authenticatie
OAuth2/OIDC, API-sleutels, rate limiting en webhooks, plus de vraag wiens rechten gelden zodra het model namens een gebruiker handelt.
Prompts en guardrails
Systeeminstructies, filters, moderatie en beleidsregels. Wij toetsen wat er van die begrenzing overblijft zodra iemand er gericht omheen werkt.
Monitoring en logging
Wat legt u vast van prompts en antwoorden, waarop wordt gealarmeerd en valt misbruik op voordat het verbruik uit de hand loopt?
Vergelijking
AI-pentest of een klassieke pentest van de applicatie?
Een AI-pentest raakt dreigingen die een gewone applicatiepentest niet dekt. In de meeste projecten zijn allebei nodig, want om het model heen staat gewoon een webapplicatie met een inlog, een database en een API.
| Aspect | AI- en LLM-pentest | Klassieke pentest van de applicatie |
|---|---|---|
| Focus | Prompts, agents, de RAG-pipeline en de logica van het model. | Web, mobiel en de backend eronder. |
| Typische dreigingen | Prompt injection, jailbreaks, uitlekkende gegevens, misbruik van tools. | SQL-injectie, XSS, CSRF, omzeilde autorisatie. |
| Methodiek | Dreigingsmodellering en aanvalsscenario's op maat. | OWASP-testmethodiek en bekende exploitatietechnieken. |
| Oplevering | Herstelstappen die op de AI-laag zijn toegesneden, plus hertest. | Pentestrapport met de bevindingen op risico gerangschikt. |
Weet u niet welke test bij uw toepassing past? Neem contact met ons op.
Klantervaringen
Wat klanten over ons zeggen
Veelgestelde vragen (FAQ)
01 Wat is een AI- en LLM-pentest?
Een beveiligingstest van een applicatie waarin een taalmodel meebeslist: de integratie met het model, de AI-agents eromheen en de RAG-pipeline. Wij toetsen of het geheel bestand is tegen prompt injection en jailbreaks, of er via het model gegevens naar buiten lekken en of een aanvaller de tools kan misbruiken die de agent mag aanroepen. Het model van de leverancier zelf testen wij niet; uw integratie eromheen wel, en daar zit in de praktijk het lek.
02 Op welke dreigingen richt een AI-pentest zich?
Directe en indirecte prompt injection, dus ook via een document dat de agent inleest, jailbreaks, het uitlekken van de systeemprompt, het onttrekken van gegevens uit de RAG-index, autorisatie die via een agent wordt omzeild, vergiftigde data in de index en aanvallen die uw verbruikskosten laten oplopen (denial of wallet). Lekt daarbij een persoonsgegeven, dan is dat een datalek in de zin van de AVG.
03 Welke platformen en modellen testen jullie?
OpenAI en Azure OpenAI, Anthropic, Google Vertex AI, Mistral, Llama en modellen die u zelf host. Aan de applicatiekant frameworks als LangChain en LlamaIndex, RAG-opstellingen en de gangbare vectordatabases. Wij werken op afstand vanuit Slowakije; voor deze test is aanwezigheid op locatie niet nodig.
04 Wat kost een AI- en LLM-pentest?
De prijs volgt de scope: het aantal integraties, of er agents met schrijfrechten in zitten, hoe groot en hoe gevoelig de RAG-index is en of wij ook de applicatie eromheen testen. Een afgebakende chatbot zonder tools vraagt aanzienlijk minder werk dan een agent die in interne systemen mag schrijven. Na een kort gesprek over de scope krijgt u een vaste, vrijblijvende offerte.
05 Is een pentest van een AI-integratie wettelijk verplicht?
Niet als zodanig. Het scherpste aanknopingspunt is de AVG: artikel 32 lid 1 sub d noemt, waar passend, 'een procedure voor het op gezette tijdstippen testen, beoordelen en evalueren van de doeltreffendheid' van de beveiligingsmaatregelen. Verwerkt uw AI-integratie persoonsgegevens, dan valt zij daaronder. De AI-verordening stelt daarnaast in artikel 15 eisen aan de nauwkeurigheid, robuustheid en cyberbeveiliging van AI-systemen met een hoog risico. De Cyberbeveiligingswet schrijft geen pentest voor: die vraagt om een risicoanalyse en om passende en evenredige maatregelen, en een pentest is de gebruikelijke manier om aan te tonen dat die maatregelen werken. Voor financiële entiteiten geldt DORA in plaats van de Cyberbeveiligingswet; artikel 7 Cbw zondert hen uit.
06 Wat krijgt u na afloop en hoe werkt de hertest?
Een technisch rapport met bewijs per bevinding en concrete herstelstappen, plus een samenvatting voor de directie. Na het herstel voeren wij een hertest uit die vastlegt welke kritieke risico's weg zijn. Wij dragen geen keurmerk: wat u van ons krijgt zijn testers met verifieerbare certificeringen op naam en een geanonimiseerd voorbeeldrapport dat u vóór ondertekening kunt inzien.