
EU GMP Annex 22.
Annex 22 ist der geplante KI-Anhang des EU-GMP-Leitfadens EudraLex Volume 4 und die erste eigenständige Regelung für KI-Modelle in computergestützten Systemen der Arzneimittelherstellung. Das computergestützte System wird weiterhin nach Annex 11 validiert, und für das eingebettete KI-Modell gelten weitergehende Anforderungen. Der Text ist noch ein Entwurf, kann das Vorgehen von Inspektoren aber schon heute prägen.
Zehn Abschnitte, eine enge Grenze für kritische Anwendungen.
Der Entwurf gilt für computergestützte Systeme im GMP-Umfeld, in denen KI-Modelle in kritischen Anwendungen wirken. Kritisch heißt hier direkter Einfluss auf Patientensicherheit, Produktqualität oder Datenintegrität. Solche Modelle sagen typischerweise Werte vorher oder klassifizieren Daten. Den Anwendungsbereich fassen wir weit, von der Produktion bis zu Qualitätsprozessen wie dem Abweichungsmanagement. Erfasst sind Machine-Learning-Modelle, die ihre Funktion durch Training erhalten haben.
Nach unserer Lesart der laufenden Diskussion bemisst sich „kritisch“ nicht am direkten Einfluss allein. Auch schwer entdeckbare Fehler und ein hoher Automatisierungsgrad sprechen für eine höhere Einstufung. Die Grenze zieht der Text bewusst eng und sieht in kritischen Anwendungen nur statische Modelle mit deterministischem Output vor. Wie sich das ins Gesamtbild der KI im GxP-Umfeld einfügt, zeigt der Blick auf die zehn Abschnitte.
Geltungsbereich & Grundsätze · Abschnitte 1-2
Abschnitt 1 begrenzt den Geltungsbereich auf kritische Anwendungen und auf statische Modelle mit deterministischem Output. Abschnitt 2 verlangt enge Zusammenarbeit aller Beteiligten mit definierten Verantwortlichkeiten. Genannt sind Prozess-SMEs, QA, Data Science, IT und Berater. Die Dokumentation zu Modell und Rollen prüft der regulierte Anwender, auch bei Modellen vom Lieferanten. Wie weit die Maßnahmen gehen, richtet sich nach dem Risiko.
Intended Use · Abschnitt 3
Die Aufgabe des Modells wird detailliert beschrieben, mit Eingangsdaten (Input Sample Space), Grenzen und möglichen Verzerrungen. Verantwortlich ist der Prozess-SME. Freigegeben wird die Beschreibung vor dem Test. Der Entwurf überträgt „Intended Use“ auf das Modell. Aus unserer Sicht kommt der Zweck aus dem Prozess, und das Modell erfüllt darin eine Aufgabe.
Akzeptanzkriterien · Abschnitt 4
Testmetriken und Akzeptanzkriterien stehen vor dem Test fest. Die Akzeptanzkriterien sollen mindestens so hoch liegen wie die Leistung des Prozesses, den das Modell ersetzt.
Testdaten · Abschnitte 5-6
Die Testdaten sind repräsentativ und stratifiziert. Technisch wie personell bleiben sie strikt von der Modell-Entwicklung getrennt, gesichert durch Zugriffskontrolle und Audit Trail. Wo eine personelle Trennung nicht möglich ist, verlangt der Entwurf das Vier-Augen-Prinzip.
Test & Erklärbarkeit · Abschnitte 7-9
Nach einem freigegebenen Testplan wird geprüft, ob das Modell generalisiert. Beim Test in kritischen Anwendungen zeichnet das System auf, welche Merkmale der Testdaten zum Ergebnis beigetragen haben, und bei der Freigabe der Testergebnisse wird geprüft, ob das Modell sich auf relevante Merkmale stützt. Techniken wie Feature-Attribution nennt der Entwurf nur beispielhaft („where applicable“). Unsichere Ergebnisse kann das Modell als „undecided“ ausweisen. Wie damit umzugehen ist, gehört aus unserer Sicht in den Prozess.
Betrieb · Abschnitt 10
Vor der Inbetriebnahme kommen Modell, System und Prozess unter Change Control, das getestete Modell zusätzlich unter Configuration Control. Modellleistung und Eingangsdaten werden auf Drift überwacht. Wo der Testaufwand des Modells reduziert wurde, sind Aufzeichnungen zu führen. Je nach Kritikalität kann das bedeuten, dass ein Mensch jedes Ergebnis nach einem festgelegten Verfahren prüft oder testet.
Der rote Faden dieser Abschnitte ist ein Wechsel im Nachweis. An die Stelle des deterministischen Einzeltests tritt statistische Evidenz. Testdaten unterliegen eigenen Anforderungen, und Metriken belegen, wie gut das Modell arbeitet. Für die GMP ist dieses Denken nicht neu. Annex 15 verlangt seit 2015 die fortlaufende Prozessverifizierung über den Lebenszyklus. Wo angemessen, stützen statistische Werkzeuge die Aussagen zu Variabilität und Prozessfähigkeit (5.29 bis 5.32). So gelesen, überträgt Annex 22 diesen Nachweis von Prozessen auf Modelle.
Regelbasierte Automatisierung ohne Machine Learning bleibt ein reiner Annex-11-Fall. Statische Machine-Learning-Modelle sind der Gegenstand des Annex 22. Dynamische, probabilistische und generative Modelle sieht der Entwurf für kritische Anwendungen dagegen nicht vor. Außerhalb kritischer Anwendungen sind sie weiterhin einsetzbar, wobei das computergestützte System, in dem sie laufen, der Risikobewertung nach dem geltenden Annex 11 unterliegt. Aus unserer Sicht gehören sie dann stets unter menschliche Aufsicht. Für generative KI und LLMs macht der Entwurf diese Aufsicht ausdrücklich zur Bedingung.
Wo der Text heute steht.
1.359 Kommentare aus 79 Organisationen in 39 Ländern, von Industrie, Behörden und Wissenschaft, belegen das Interesse am Entwurf. Der Weg zur endgültigen Fassung führt über fünf Stationen.
- 1
Entwurf und Konsultation
Im Juli 2025 stellte die Europäische Kommission den Entwurf des ersten eigenständigen KI-Anhangs des EU-GMP-Leitfadens zur Konsultation. Erarbeitet hat ihn die Annex-22-Drafting-Group der GMDP Inspectors Working Group. Die Frist für Kommentare lief bis Oktober 2025. Der Anhang gehört zum Paket der EudraLex-Volume-4-Revision mit Chapter 4 (Dokumentation) und der Annex-11-Revision.
- 2
Auswertung der Kommentare
Die Auswertung, die der Vorsitzende der GMDP Inspectors Working Group im April 2026 vorstellte, zeigt klare Schwerpunkte, allen voran den Ruf nach einem risikobasierten Ansatz ohne kategorische Technologie-Ausschlüsse.
- 3
Expertenworkshop
Tag eins am 30. Juni 2026 war eine offene Session, in der verbandsnominierte Experten Meinung und Evidenz vortrugen. Tag zwei am 1. Juli war eine geschlossene Session ohne Übertragung. Die sechs Themenfelder reichten von regulatorischen Wegen für adaptive Modelle über menschliche Aufsicht bis zur Cybersicherheit.
- 4
Report und überarbeiteter Entwurf
Angekündigt ist zunächst ein Report mit den Expertenbeiträgen. Danach wird eine Fassung erwartet, die Konsultations- und Workshop-Ergebnisse verarbeitet. Wie deckungsgleich die Signale aus Barcelona (Rapporteur der Annex-22-Drafting-Group), aus Boston (FDA-Experte) und vom EMA-Workshop ausfallen, zeigt unsere Zusammenschau Drei Signale, eine Linie. Ein transatlantisches Signal liegt seit dem 14. Januar 2026 vor. EMA und FDA haben gemeinsame Guiding Principles of Good AI Practice veröffentlicht. Die Prinzipien sehen vor, dass Validierung, Risikominderung und Aufsicht dem Context of Use und dem ermittelten Modellrisiko angemessen sind (Prinzip 2), ebenso planmäßiges Monitoring und periodische Neubewertung, etwa im Hinblick auf Datendrift (Prinzip 9).
- 5
Finalisierung
Veröffentlichung und Übergangsfristen stehen aus. Bis dahin gilt Annex 11 unverändert.
Bleiben generative KI und LLMs außen vor?
Ja. Auf generative KI und Large Language Models ist der Entwurf nicht anwendbar, und in kritischen GMP-Anwendungen sollen sie nicht eingesetzt werden. Außerhalb kritischer Anwendungen bleibt ihr Einsatz möglich, stets mit menschlicher Prüfung der Ergebnisse (Human-in-the-Loop, HITL). Die Verantwortung für den Einsatz verbleibt beim regulierten Unternehmen. Die EMA hat die Kommentar-Schwerpunkte der Konsultation so zusammengefasst:
Woran entscheidet sich der finale Text von Annex 22?
Konsultation und Expertenworkshop haben die Debatte auf drei Fragen eingegrenzt, an denen sich entscheidet, wie weit die endgültige Fassung vom Konsultationsentwurf abweicht. Die erste Frage ist, ob die Grenze weiter an der Modellklasse hängt oder zum Risiko der Anwendung wandert. Bei der zweiten geht es um die Aufsicht: fester Human-in-the-Loop-Mechanismus oder Human Oversight mit mehreren Formen. Die dritte zielt auf die Evidenz, die die EMA für Guardrails verlangt, bevor dynamische Modelle in GMP-Anwendungen zugelassen werden. Öffentlich bekannt ist bisher die Richtung. Laut Workshop-Ankündigung untersucht die EMA Guardrails und weitere Kontroll- und Minderungsmaßnahmen.
Bleibt die Grenze an der Modellklasse?
Für kritische Anwendungen schließt der Entwurf dynamische, probabilistische und generative Modelle aus. Die Logik des Qualitätsrisikomanagements spricht für den umgekehrten Ansatz. Höheres Risiko bedeutet stärkere Kontrollen, kein pauschales Verbot. Die EMA nannte das erste Workshop-Themenfeld „Regulatory Pathways for Adaptive/probabilistic AI models in GMP“. Die Leitfrage dazu lautete wörtlich „How could we accommodate adaptive and probabilistic models in Annex 22?“ Zur Debatte steht damit ein regulatorischer Weg für genau diese Modelle. In der Ankündigung des Workshops führt die EMA Guardrails und weitere Kontrollmaßnahmen als Teil eines vorgeschlagenen risikobasierten Ansatzes an.
Wie viel Aufsicht verlangt die endgültige Fassung?
Der Entwurf verankert Human-in-the-Loop an drei Stellen: im Geltungsbereich als Bedingung für generative Modelle außerhalb kritischer Anwendungen, in den Abschnitten 3.3 und 10.5 jeweils als Ausgleich für reduzierten Testaufwand. Die Konsultation verlangte hier vor allem Klarheit. Im Expertenworkshop vertrat die EFPIA die Position, dass Aufsicht ein Konzept mit mehreren Formen ist, etwa HITL, Überwachung im Betrieb oder Governance-Kontrollen. Nach dieser Lesart ergibt sich die angemessene Form aus der Risikobewertung. Der Wechsel vom Mechanismus zum Konzept wäre eine der klarsten Weichenstellungen in der endgültigen Regelung. Warum der Wechsel bei der Verantwortung beginnt, begründet unser Beitrag zum GAMP D-A-CH Forum: Wer widerspricht, wenn das System spricht? Für ISPE iSpeak haben wir ausgeführt, dass der Mensch im Loop allein noch keine Kontrolle herstellt: Human-in-the-Loop as an Illusion of Control?
Welche Evidenz für Guardrails?
Der Workshop fragte ausdrücklich nach Evidenz: Wie wirksam sind Kontrollmaßnahmen und Guardrails, die einen risikobasierten Ansatz tragen sollen? Am ersten Workshoptag stellte die PDA fünf GMP-Anwendungsfälle vor, von der adaptiven Klimaregelung im Reinraum über KI-Agenten im Abweichungsmanagement bis zur modellprädiktiven Regelung eines Bioreaktors. Dazu kam eine dreistufige Guardrail-Architektur. Am Eingang steht Ausreißererkennung, im Modell stehen Konfidenzverfahren, am Ausgang harte Regelgrenzen und statistische Drift-Erkennung mit CUSUM und EWMA. Die ISPE ergänzte, dass Guardrails selbst klassifizierende Systeme mit eigenen Fehlerraten sind. Sie brauchen deshalb denselben Nachweis wie das Modell. Wir erwarten von jeder Kontrolle, die das Risiko eines Modells senken soll, einen eigenen Wirksamkeitsnachweis mit Metriken, Testansatz und Monitoring. Ohne ihn verschiebt sie das Risiko nur vom Modell in die ungeprüfte Kontrolle.
Wie greifen Chapter 4, Annex 11 und Annex 22 ineinander?
Die drei Entwürfe der EudraLex-Volume-4-Revision sind aufeinander bezogen. Chapter 4 regelt die Dokumentation. Es stellt klar, dass die Verantwortung für die Integrität von Dokumenten, Aufzeichnungen und Daten beim regulierten Anwender bleibt, auch wenn KI oder andere automatisierte Mittel diese Inhalte erzeugen oder verarbeiten. Stützt KI eine Entscheidung in der Herstellung, gilt Annex 11. In kritischen Anwendungen kommt Annex 22 hinzu. Der Annex-11-Entwurf bildet den Rahmen für jedes computergestützte System, mit Risikomanagement, Security, Zugriffsverwaltung, Audit Trails und Periodic Review. Dazu gehört der Grundsatz, dass ein neues System das Gesamtrisiko des Prozesses nicht erhöhen soll. Annex 22 setzt dort an und beschreibt als ergänzende Leitlinie, was Annex 11 für ein trainiertes Modell nicht abdeckt: Intended Use des Modells im Sinne des Entwurfs, Testdaten getrennt von den Trainings- und Validierungsdaten der Modellentwicklung, Akzeptanzkriterien mindestens auf dem Niveau des ersetzten Prozesses, Erklärbarkeit, Konfidenzschwellen und Monitoring im Betrieb.
Annex 22 verweist für den Grundsatz „kein Leistungsabfall“ auf Annex 11 Ziffer 2.7. Im Annex-11-Entwurf steht dieser Grundsatz unter 2.8, während Ziffer 2.7 dort die Security behandelt.
Der Entwurf zieht die Grenze deutlich.
„Following the above, the document does not apply to Generative AI and Large Language Models (LLM), and such models should not be used in critical GMP applications.“
EU GMP Annex 22 (Artificial Intelligence), Entwurf zur Konsultation 2025, Abschnitt 1 „Scope“.
Ob dieser Ausschluss in der endgültigen Fassung hält, ist offen. Die Nachweislogik dahinter gilt in beiden Fällen: Intended Use, unabhängige Testdaten, Monitoring und eine Kritikalitätsbewertung, die über den direkten Einfluss hinausgeht. Mehr als nötig verlangt der Entwurf aus unserer Sicht zum Beispiel in Abschnitt 6.5, Staff Independency. Die Absicht dahinter ist klar. Testdaten sollen nicht verdeckt doch ins Training fließen, nur damit das Modell auf dem Papier besteht. Die im Entwurf angelegte Lösung, personelle Trennung oder ersatzweise das Vier-Augen-Prinzip, ist eine mögliche Ausprägung des Wie. Je nach digitaler Reife einer Organisation gibt es wirksamere Lösungen: Zugriffskontrolle und eine integrierte MLOps-Infrastruktur mit Data Lineage, die nachvollziehbar macht, welche Daten an welcher Stelle für welche Modellvariante verwendet wurden. Der Review prüft dann, ob diese Infrastruktur den Anforderungen entsprechend genutzt wurde. So bleibt der Blick auf der entscheidenden Frage, ob die Testdaten geeignet und aussagekräftig genug sind, um eine realistische Leistungsangabe für den Betrieb zu erlauben. Ähnlich vermischen 4.3 und 8.2 das Was mit dem Wie. In 4.3 setzt der Grundsatz „kein Leistungsabfall“ einen bekannten Vorprozess und einen Eins-zu-eins-Ersatz voraus. In 8.2 hat der Entwurf Modelle der Bildverarbeitung im Blick, deren Merkmale sich prüfen lassen. Bei anderen Modellklassen ist ein solcher Review in diesem Sinne kaum noch möglich, und Interpretierbarkeit passend zum Context of Use wäre das bessere Ziel.
Was Sie vor der endgültigen Fassung umsetzen können.
Annex 11 liefert den Rahmen für die Bausteine des Entwurfs, und die Aufsicht gehört in eine AI Governance mit Human Oversight.
Wie das in der Praxis aussieht, haben wir im Juni 2026 in einem Workshop auf dem ISPE AI in Life Sciences Summit in Boston durchgespielt. Ein RAG-System mit dem Sprachmodell eines Drittanbieters klassifiziert Abweichungsmeldungen im GMP-Betrieb als kritisch, schwerwiegend oder geringfügig. Die QA übte dabei die Human Oversight aus und prüfte jede Einstufung, bevor sie galt. Ob eine solche Anwendung als kritisch gilt, entscheidet die Kritikalitätsbewertung des Betreibers, unabhängig von der nachgelagerten Prüfung. Lieferant und reguliertes Unternehmen sortierten zehn Lücken unabhängig voneinander in Ausschlusskriterien, lösbare Punkte oder akzeptables Risiko und verhandelten daraus eine gemeinsame Liste der Pflichtnachweise. Nicht delegierbar blieben beim Unternehmen der Intended Use im eigenen Prozess, die Akzeptanzkriterien und das Restrisiko. Model Card, klassenspezifische Metriken und ein vom Training getrenntes Testset gehörten zu den Nachweisen, die das Unternehmen vom Lieferanten einforderte.
Diese Bausteine prüfen wir und richten sie mit Ihnen ein:
Häufige Fragen zu Annex 22.
Ein Termin steht nicht fest. Die Konsultation endete im Oktober 2025, und der Expertenworkshop der EMA fand am 30. Juni und 1. Juli 2026 statt. Angekündigt ist ein Workshop-Report. Danach werden ein überarbeiteter Entwurf, die Finalisierung und Übergangsfristen erwartet. Bis dahin wird das computergestützte System nach Annex 11 validiert. Für die Nachweistiefe gibt das Qualitätsrisikomanagement nach ICH Q9(R1) die Orientierung.
Formal fallen generative KI und LLMs nicht in den Anwendungsbereich von Annex 22, doch der Entwurf äußert sich klar zu ihnen. In kritischen GMP-Anwendungen sollen sie nicht eingesetzt werden, und die Nachweis-Abschnitte gelten nur für statische Modelle. Außerhalb kritischer Anwendungen dürfen sie eingesetzt werden, wenn Menschen die Ergebnisse prüfen. Verantwortlich bleibt das regulierte Unternehmen. Dieser Ausschluss ist der zentrale Kritikpunkt der Konsultation, und die kommende Fassung kann hier anders aussehen.
Nein. Der Entwurf kennt keine Zonen im Sinne der Reinraumklassen aus Annex 1. Er unterscheidet entlang zweier Achsen. Anwendungen gelten je nach direktem Einfluss auf Patientensicherheit, Produktqualität oder Datenintegrität als kritisch oder nicht kritisch. Modelle unterscheidet der Entwurf in statische Modelle mit deterministischem Output und in dynamische, probabilistische oder generative Modelle. Aus beiden Achsen ergibt sich, welche Abschnitte gelten und ob ein Einsatz in kritischen Anwendungen vorgesehen ist.
Nein. Annex 22 ist als ergänzende Leitlinie zu Annex 11 angelegt. Das computergestützte System bleibt nach Annex 11 validiert, und Annex 22 regelt zusätzlich den Nachweis für das eingebettete Modell, von Intended Use bis Betrieb.
Annex 22 konzentriert sich auf das Modell, also auf Training, Prüfung und den Nachweis seiner Eignung. Wir weiten den Blick. Ein KI-System bzw. KI-Subsystem integriert ein oder mehrere Modelle und weitere Funktionen, etwa Kontrollen („Guardrails“), zu einer Systemkomponente. So lässt sich die Leistung auf mehreren Ebenen messen und damit die Eignung aller Subkomponenten und ihres Zusammenspiels prüfen.
Abschnitt 2.1 des Entwurfs verlangt enge Zusammenarbeit aller Beteiligten, von der Algorithmus-Auswahl über Training, Validierung (im Sinne der Modellentwicklung) und Test bis zum Betrieb. Der Entwurf nennt Prozess-SMEs, QA, Data Science, IT und Berater, jeweils mit angemessener Qualifikation, definierten Verantwortlichkeiten und passenden Zugriffsrechten. Für generative Modelle außerhalb kritischer Anwendungen bleibt qualifiziertes Personal dafür verantwortlich, dass die Ergebnisse für den Intended Use geeignet sind. Die Zusammenarbeit nach Abschnitt 2.1 ist zugleich Knowledge Management. ICH Q10 nennt es neben dem Qualitätsrisikomanagement als einen der beiden Enabler des Qualitätssystems. Wissen über Modelle, Daten und ihre Grenzen bleibt so in der Organisation.
Betreiber können den Kern der Anforderungen schon vor der Finalisierung erfüllen. KI-Inventar, Intended Use und Kritikalitätsbewertung je Anwendung, Testmetriken, unabhängige Testdaten sowie Monitoring und Human Oversight lassen sich mit dem geltenden Annex 11 umsetzen. Wie tief der Nachweis gehen muss, zeigt ICH Q9(R1). Die Methodik für KI-befähigte Systeme beschreibt seit Juli 2025 der ISPE GAMP Guide: Artificial Intelligence. Der Entwurf macht vieles davon für KI-Modelle explizit.
Stand:
Annex 22 braucht den Gesamtkontext.
Annex-22-Readiness beginnt vor dem finalen Text.
Im Erstgespräch klären wir, was Sie mit KI vorhaben, wo Ihre Anwendungen heute stehen und was Annex 22 für Sie bedeutet. Kostenfrei, etwa 30 Minuten.
Erstgespräch vereinbaren


