AI- en LLM-pentest laten uitvoeren

Steeds meer toepassingen laten een taalmodel meebeslissen: een chatbot die klantgegevens opzoekt, een agent die facturen inboekt, een assistent die uw documentatie doorzoekt. Daarmee verschuift het aanvalsoppervlak. Een AI-pentest laat zien of uw integratie bestand is tegen prompt injection, jailbreaks, gegevens die via het model naar buiten lekken en agents die meer mogen dan de gebruiker die ze aanstuurt.

Wij testen volgens OWASP Top 10 for LLM en met aanvalsscenario's die wij in de praktijk hebben zien werken. Een LLM-pentest beslaat het model zelf, de RAG-pipeline, de AI-agents en de tools die zij mogen aanroepen, de API's eromheen en de rest van de integratieomgeving: identiteit, autorisatielogica en de maatregelen die het geheel moeten begrenzen.

Pentest van AI-modellen en LLM-integraties door HAXORIS

Zij vertrouwen op ons

  • Logo van Raiffeisen Processing Centre
  • Logo van Penta Hospitals
  • Logo van Pixel Federation
  • Logo van het Slowaakse ministerie van Financiën
  • Logo van DanubePay
  • Logo van Alison
  • Logo van Ditec
  • Logo van Sanaclis
  • Logo van Piano
  • Logo van Ultima Payments
  • Logo van Amerge
  • Logo van Digital Systems

Wat is een AI- en LLM-pentest en waarom is die nodig?

Een taalmodel behandelt instructies en gegevens als één en dezelfde stroom tekst. Wie tekst in die stroom krijgt, via een geüpload document, een e-mail die de agent leest of een pagina in de RAG-index, stuurt daarmee het gedrag van het model. Dat is de kern van prompt injection, en geen enkele scanner van webapplicaties vindt het. Hetzelfde geldt voor een agent die technisch gezien bij alle klantdossiers kan terwijl de gebruiker erachter maar bij één dossier hoort te kunnen.

Wij toetsen dat handmatig, in uw eigen omgeving en met uw eigen data. U krijgt geen lijst met theoretische risico's, maar bevindingen op volgorde van herstel: wat gerepareerd moet worden voordat de integratie live gaat en wat kan wachten tot de volgende release.

Ervaring

Wij testen AI-integraties zoals ze in productie draaien, met de koppelingen en de data die er echt in zitten. Elke bevinding komt met een reproduceerbaar bewijs; wat wij niet aan de praat krijgen, haalt het rapport niet.

Transparantie

Scope, testaccounts en de grenzen van wat wij mogen proberen leggen wij vooraf schriftelijk vast. Vindt een tester iets kritieks, dan hoort u dat dezelfde dag en niet pas bij de oplevering.

Samenwerking

Wij werken rechtstreeks met de ontwikkelaars die de integratie hebben gebouwd. Het rapport is zo geschreven dat een aanpassing in de systeemprompt, de tooldefinitie of de autorisatielaag meteen te maken is.

Professionaliteit

Wij testen uitsluitend op basis van schriftelijke toestemming en binnen de afgesproken scope. Prompts, documenten en modeluitvoer die wij onderweg zien, blijven vertrouwelijk, ook na afloop van de opdracht.

Testproces

Hoe verloopt een AI- en LLM-pentest?

Wij beginnen met dreigingsmodellering op de architectuur en toetsen daarna met de hand wat een aanvaller er werkelijk mee bereikt. OWASP Top 10 for LLM is daarbij de leidraad, niet de afvinklijst.

1

Adviesgesprek en scope

Wij brengen de architectuur in kaart: welk model, welke data eromheen, welke tools de agent mag aanroepen en waar de integratie raakt aan systemen die er niet bij horen.

2

Prompts, API's en integratie testen

Wij toetsen de invoer aan alle kanten, de autorisatie achter elke tool en de guardrails die het gedrag van het model moeten begrenzen.

3

Aanvalsscenario's naspelen

Directe en indirecte prompt injection, jailbreaks, het uitlekken van de systeemprompt en van gegevens uit de RAG-index, en misbruik van de tools die de agent mag aanroepen.

4

Rapport, aanbevelingen en hertest

U krijgt de bevindingen met bewijs en per bevinding een concrete herstelstap. Na het herstel voeren wij een hertest uit en leggen wij vast welke risico's daadwerkelijk weg zijn.

Scope

Wat testen wij in AI- en LLM-integraties?

De dekking loopt van het model tot de logging: de data die erin gaat, de tools die eruit worden aangeroepen en alles wat daartussen zou moeten begrenzen.

LLM-integraties

OpenAI en Azure OpenAI, Anthropic, Google Vertex AI, Mistral en modellen die u zelf host. Wij testen uw integratie, niet het model van de leverancier.

RAG-pipeline

Het inlezen en indexeren van documenten, de retrieval en de vectordatabase. Wie de index kan vullen, stuurt het antwoord: daar kijken wij als eerste, samen met de vraag of de index documenten teruggeeft die de vragensteller niet mag zien.

AI-agents en tools

Tool use en function calling, plug-ins en de orkestratie van meerstapsopdrachten. De vraag is steeds of de agent iets kan doen wat de gebruiker erachter niet mag.

API's en authenticatie

OAuth2/OIDC, API-sleutels, rate limiting en webhooks, plus de vraag wiens rechten gelden zodra het model namens een gebruiker handelt.

Prompts en guardrails

Systeeminstructies, filters, moderatie en beleidsregels. Wij toetsen wat er van die begrenzing overblijft zodra iemand er gericht omheen werkt.

Monitoring en logging

Wat legt u vast van prompts en antwoorden, waarop wordt gealarmeerd en valt misbruik op voordat het verbruik uit de hand loopt?

Vergelijking

AI-pentest of een klassieke pentest van de applicatie?

Een AI-pentest raakt dreigingen die een gewone applicatiepentest niet dekt. In de meeste projecten zijn allebei nodig, want om het model heen staat gewoon een webapplicatie met een inlog, een database en een API.

AspectAI- en LLM-pentestKlassieke pentest van de applicatie
FocusPrompts, agents, de RAG-pipeline en de logica van het model.Web, mobiel en de backend eronder.
Typische dreigingenPrompt injection, jailbreaks, uitlekkende gegevens, misbruik van tools.SQL-injectie, XSS, CSRF, omzeilde autorisatie.
MethodiekDreigingsmodellering en aanvalsscenario's op maat.OWASP-testmethodiek en bekende exploitatietechnieken.
OpleveringHerstelstappen die op de AI-laag zijn toegesneden, plus hertest.Pentestrapport met de bevindingen op risico gerangschikt.

Weet u niet welke test bij uw toepassing past? Neem contact met ons op.

Klantervaringen

Wat klanten over ons zeggen

Veelgestelde vragen (FAQ)

01 Wat is een AI- en LLM-pentest?

Een beveiligingstest van een applicatie waarin een taalmodel meebeslist: de integratie met het model, de AI-agents eromheen en de RAG-pipeline. Wij toetsen of het geheel bestand is tegen prompt injection en jailbreaks, of er via het model gegevens naar buiten lekken en of een aanvaller de tools kan misbruiken die de agent mag aanroepen. Het model van de leverancier zelf testen wij niet; uw integratie eromheen wel, en daar zit in de praktijk het lek.

02 Op welke dreigingen richt een AI-pentest zich?

Directe en indirecte prompt injection, dus ook via een document dat de agent inleest, jailbreaks, het uitlekken van de systeemprompt, het onttrekken van gegevens uit de RAG-index, autorisatie die via een agent wordt omzeild, vergiftigde data in de index en aanvallen die uw verbruikskosten laten oplopen (denial of wallet). Lekt daarbij een persoonsgegeven, dan is dat een datalek in de zin van de AVG.

03 Welke platformen en modellen testen jullie?

OpenAI en Azure OpenAI, Anthropic, Google Vertex AI, Mistral, Llama en modellen die u zelf host. Aan de applicatiekant frameworks als LangChain en LlamaIndex, RAG-opstellingen en de gangbare vectordatabases. Wij werken op afstand vanuit Slowakije; voor deze test is aanwezigheid op locatie niet nodig.

04 Wat kost een AI- en LLM-pentest?

De prijs volgt de scope: het aantal integraties, of er agents met schrijfrechten in zitten, hoe groot en hoe gevoelig de RAG-index is en of wij ook de applicatie eromheen testen. Een afgebakende chatbot zonder tools vraagt aanzienlijk minder werk dan een agent die in interne systemen mag schrijven. Na een kort gesprek over de scope krijgt u een vaste, vrijblijvende offerte.

05 Is een pentest van een AI-integratie wettelijk verplicht?

Niet als zodanig. Het scherpste aanknopingspunt is de AVG: artikel 32 lid 1 sub d noemt, waar passend, 'een procedure voor het op gezette tijdstippen testen, beoordelen en evalueren van de doeltreffendheid' van de beveiligingsmaatregelen. Verwerkt uw AI-integratie persoonsgegevens, dan valt zij daaronder. De AI-verordening stelt daarnaast in artikel 15 eisen aan de nauwkeurigheid, robuustheid en cyberbeveiliging van AI-systemen met een hoog risico. De Cyberbeveiligingswet schrijft geen pentest voor: die vraagt om een risicoanalyse en om passende en evenredige maatregelen, en een pentest is de gebruikelijke manier om aan te tonen dat die maatregelen werken. Voor financiële entiteiten geldt DORA in plaats van de Cyberbeveiligingswet; artikel 7 Cbw zondert hen uit.

06 Wat krijgt u na afloop en hoe werkt de hertest?

Een technisch rapport met bewijs per bevinding en concrete herstelstappen, plus een samenvatting voor de directie. Na het herstel voeren wij een hertest uit die vastlegt welke kritieke risico's weg zijn. Wij dragen geen keurmerk: wat u van ons krijgt zijn testers met verifieerbare certificeringen op naam en een geanonimiseerd voorbeeldrapport dat u vóór ondertekening kunt inzien.

Laat uw AI-toepassing of LLM-integratie testen voordat die live gaat

Gratis adviesgesprek