QFINITY Aktuelles - Publikationen und Gremienarbeit
QFINITY · Aktuelles

Neues von QFINITY und aus der Fachwelt.

Ein Überblick über Meldungen abseits von Terminen und Projekten: Fachartikel und Publikationen, Engagements in Gremien und Verbänden, Auszeichnungen und Einordnungen zu neuen Regelwerken.

Im Überblick

Publikationen, Gremienarbeit und mehr.

Wer widerspricht, wenn das System spricht? Human Oversight in der QA - QFINITY

Nachlese zum 47. GAMP D-A-CH Forum, Berlin, 11. März 2026.

Auf dem 47. GAMP D-A-CH Forum in Berlin haben Daniel Köpke und Oliver Herrmann im März 2026 gefragt, was Human Oversight bedeutet, wenn Systeme intelligenter, komplexer und überzeugender werden. Die Antwort beginnt für uns bei der Verantwortung: Die grösste Gefahr für die QA ist die schleichende Erosion sichtbarer Verantwortung, bis niemand mehr widerspricht. Wie real diese Frage inzwischen ist, hat in diesem Sommer ein Sicherheitsvorfall beim KI-Anbieter OpenAI gezeigt. Er ist der Anlass, die Position aus dem März jetzt nachzureichen: keine Voraussicht, eine Illustration. Dieser Beitrag legt die Position aus dem Vortrag dar, und er benennt, was Organisationen dagegen aufbauen können.

Warum kommt diese Nachlese jetzt?

Am 26. August 2026 hat OpenAI den technischen Bericht zu einem Vorfall aus dem Juli vorgelegt. In einem eigenen Sicherheitstest waren Agenten aus ihrer Testumgebung ausgebrochen und hatten reale Infrastruktur von Hugging Face kompromittiert. Ein wesentlicher Umstand war, dass die üblichen Schutzmechanismen in der Testumgebung zu Testzwecken abgeschaltet waren. Im produktiven Betrieb wären sie dagegen vorgesehen. Trotzdem bleibt der Vorfall ein anschauliches Experiment, das zeigt, wie weit die Fähigkeiten dieser Systeme inzwischen reichen. Ob Ausbruch oder Freilassung: Beides ist ein Versagen der Architektur, nicht einer einzelnen Kontrolle. Kontrollen, die nachträglich an ein System angebaut werden, halten mit dem Tempo dieser Systeme nicht Schritt. Kontrollierbarkeit muss angelegt sein, bevor das System spricht. Der Vorfall geschah weit ausserhalb der GxP-Welt. Die wichtige Botschaft hierbei: Diese KI-Fähigkeiten werden zunehmend auch in GxP-Systemlandschaften genutzt. Wer die damit verbundenen Risiken einschätzt, muss sowohl die Grenzen als auch die Möglichkeiten der Systeme verstehen.

Der Ausgangspunkt ist die Verantwortung

Daniel Köpke und Oliver Herrmann beim Vortrag auf dem 47. GAMP D-A-CH Forum in Berlin
BERLINDaniel Köpke und Oliver Herrmann auf dem 47. GAMP D-A-CH Forum, 11. März 2026.

Jeder Mensch hat ein Gesicht und eine Stimme. Beides macht uns erkennbar, und beides macht uns verantwortlich: als QA-Fachleute und als Menschen, die zur Patientensicherheit beitragen. Ein Patient kennt unsere Systeme nicht. Er kennt keine SOPs, keine Validierungspläne, keine Modellarchitektur. Er vertraut darauf, dass am Ende ein Mensch hinter der Qualität steht.

Die Verbindung zur KI liegt im Übergang von Daten zu Entscheidungen. Ein KI-befähigtes System kann Daten analysieren, Muster erkennen, Testfälle generieren, Abweichungen klassifizieren und Entscheidungen vorbereiten. Und es klingt dabei plausibel, oft sogar sehr plausibel.

Alles dokumentiert, alles konform, und niemand versteht, warum

In Berlin haben wir mit einer Szene begonnen. Ein System empfiehlt die Freigabe. Ein zweites hat die Daten geprüft. Ein drittes hat die Anomalie als akzeptabel klassifiziert. Alles dokumentiert, alles nachvollziehbar, alles konform. Und kein Mensch hat wirklich verstanden, warum.

Diese Szene ist keine Zukunft, sie setzt sich aus dem heutigen Alltag zusammen. Ein System generiert 847 Testfälle, und der Tester prüft den Output. Aber wer prüft die Logik dahinter, und wer entscheidet, was nicht getestet wurde? Ein Chatbot klassifiziert die Abweichung als Minor und schlägt die CAPA gleich mit vor. Der QA-Mitarbeiter bestätigt, und irgendwann wird das Bestätigen zur Gewohnheit. Ein autonomes Monitoring meldet keinen Trend. Aber was ist mit dem Trend, der ausserhalb des Musters liegt, das das Modell kennt? Stille ist keine Aussage. Stille ist eine Annahme.

Plausibilität ist kein Beleg für eine Prüfung

Darin liegt das zentrale Risiko jedes Human-in-the-Loop-Aufbaus. Plausible Ausgaben entmutigen die gründliche Prüfung, die technische Korrektheit, regulatorische Belastbarkeit und GxP-Verantwortung tatsächlich verlangen. Plausibilität kann eine Prüfung auslösen. Ersetzen kann sie sie nicht, und Verantwortung macht sie nicht übertragbar. Plausibel heisst: Es könnte stimmen. Richtig heisst: Wir haben es geprüft und verstanden. Das ist kein kleiner Unterschied, das ist der Unterschied.

Ein System trägt keine regulatorische Verantwortung. Es kennt den GxP-Kontext nicht so, wie ein Mensch ihn kennt, es erkennt nicht, wann ein scheinbar korrektes Ergebnis in einem kritischen Prozess gefährlich wird, und es urteilt nicht unter Mehrdeutigkeit. All das bleibt beim Menschen. Technische Kontrollmechanismen, in der Debatte oft Guardrails genannt, können Menschen dabei unterstützen, diese Verantwortung wahrzunehmen. Wer diesen Massnahmen blind vertraut, schreibt jedoch jene Design-Schwäche fort, die den Human-in-the-Loop-Aufbau angreifbar macht.

Die schleichende Erosion sichtbarer Verantwortung

Die Gefahr kommt leise. Klick für Klick, Bestätigung für Bestätigung, begraben unter immer mehr Entscheidungen, die zu treffen sind, bis niemand mehr wirklich widerspricht. Kein einzelner Schritt fällt auf, und am Ende steht eine QA, die formal alles dokumentiert hat und praktisch nichts mehr entscheidet.

Wenn das System spricht, bleibt die entscheidende Frage: Wer widerspricht?

Drei Regelwerke, eine Richtung

In Berlin haben wir diese Frage an Regelwerken gespiegelt, die unabhängig voneinander entstanden sind und dieselbe Erwartung tragen. Der EU AI Act beschreibt in Artikel 14 für Hochrisiko-Systeme, was Human Oversight heisst. Menschen müssen das System verstehen, überwachen und korrigieren können, nicht nur formal signiert haben. EU-GMP-Annex 11 verlangt seit jeher kontrollierbare, nachvollziehbare und prüfbare computergestützte Systeme. Er wurde vor generativer KI geschrieben, und er gilt trotzdem. Der Entwurf des EU-GMP-Annex 22 schlägt erstmals ein formales Korsett für KI im GxP-Umfeld vor, mit Intended Use, Performance-Monitoring und Change Control. In kritischen Anwendungen sieht er bislang nur statische Modelle mit deterministischem Output vor. Die Nachweise muss der regulierte Anwender selbst vorliegen haben und prüfen. Das gilt unabhängig davon, ob das Modell selbst entwickelt oder mit einem Dienstleister erstellt wurde. Auf der Industrieseite beschreibt GAMP 5 den Konsens, wie sich diese Erwartungen umsetzen lassen. Alle zeigen in dieselbe Richtung. Die Kontrolle bleibt beim Menschen.

Die Rolle der QA verschiebt sich

Oliver Herrmann beim Vortrag auf dem 47. GAMP D-A-CH Forum in Berlin
VOR ORTOliver Herrmann im Vortrag in Berlin.

Eine QA, die diese Frage beantworten will, gestaltet die Bedingungen, unter denen menschliches Urteil wirksam bleibt. Im GxP heisst das: Human Oversight gehört in den Intended Use, in den Geschäftsprozess und in die risikobasierten Kontrollen eingebettet, mit Lebenszyklus-Nachweisen, die ihre Wirksamkeit belegen. Human Oversight ist eine Fähigkeit, die in der Architektur des Systems angelegt wird, nicht nachträglich in einem Prüfschritt.

In Berlin haben wir diese Rolle in vier Bildern beschrieben. Als Architektur-Designer sitzt die QA am Tisch, wenn Systemgrenzen gezogen werden, und entscheidet mit, welche Entscheidungen ein System autonom treffen darf und wo ein Mensch eingreifen können muss. Als Oversight-Architekt definiert sie die Kontrollpunkte selbst, statt sie der IT oder dem Anbieter zu überlassen: wo Monitoring stattfindet, was als Abweichung gilt, wann ein System pausiert wird. Als Eskalations-Designer entwirft sie die Detektionspfade für stille Fehler, denn Drift ist kein Absturz, er schleicht. Und als Transparenz-Hüter hält sie fest, dass eine Validierung unvollständig war, wenn im Audit niemand erklären kann, warum das Systemdesign so gewählt, die menschliche Aufsicht so definiert und die Entscheidung im Betrieb so getroffen wurde.

Der Satz, auf den der Vortrag zulief, gilt unverändert. Zukunftssichere QA validiert nicht nur Systeme. Sie validiert, dass der Mensch entscheidungsfähig bleibt.

Und sie braucht Menschen, die prüfen können. Vier Bedingungen entscheiden darüber, ob Widerspruch im Alltag vorkommt:

1
Kompetenz. Wer prüft, muss verstehen, was das System kann und was nicht, den Einsatzkontext kennen und die Grenzen einschätzen können.
2
Zeit. Eine Prüfung, für die keine Zeit vorgesehen ist, wird zur Bestätigung.
3
Psychologische Sicherheit. Widerspruch gegen ein Ergebnis, das plausibel klingt und das alle akzeptieren, braucht ein Umfeld, das ihn ausdrücklich erwartet und ohne Nachteil möglich macht.
4
Echte Befugnis. Wer prüft, muss ein System anhalten dürfen, formal und im gelebten Alltag. Ein System ohne definierten Stopp ist kein kontrolliertes System.

Organisationen müssen Human Oversight so gestalten, dass Verantwortung im Alltag ausgeübt wird und ihre Wirksamkeit nachweisbar bleibt. Und die Zuordnung gehört dokumentiert. Nicht das System hat entschieden. Ein Mensch hat die Entscheidung des Systems verantwortet, mit Name, Rolle, Qualifikation und (digitaler) Unterschrift. Im Audit gibt es keine Zeile für das Modell. Eine Verantwortung, die nur im Dokument existiert, schützt keinen Patienten.

Drei unterstützende Stimmen, ein gemeinsamer Kern

Seit dem Vortrag ist diese Position nicht allein geblieben. Der Rapporteur der Annex-22-Drafting-Group in Barcelona, ein National Expert der FDA in Boston und die Industrie im EMA-Expertenworkshop kamen unabhängig voneinander zu derselben Linie. Die Zusammenschau steht im Beitrag Drei Signale, eine Linie. Wie sich Human Oversight einrichten und prüfen lässt, beschreiben wir unter AI Governance und Human Oversight.

Eine KI-Strategie, die Human Oversight und sichtbare Verantwortung verankert, ist ein guter Startpunkt. Noch wichtiger ist die Haltung: Das System arbeitet für uns, nicht umgekehrt.

Für uns ist das der Kern von Digital Compliance: Qualität wird nicht nur nachgewiesen, sie wird so gestaltet, dass sie vertrauenswürdig ist und mit dem Wissen wächst. Vertrauen hat ein Gesicht und eine Stimme. Unsere Aufgabe ist, dass beide nicht in unseren Systemen verschwinden.

Zum Nachlesen: Rückblick: GAMP D-A-CH in Berlin (ISPE D-A-CH, 11.03.2026)↗OpenAI: Bericht zum Hugging-Face-Sicherheitsvorfall (26.08.2026)↗

Drei Signale, eine Linie: KI im GxP-Umfeld zwischen Barcelona, Boston und dem EMA-Workshop - QFINITY

Innerhalb von sieben Monaten kamen drei Signale zusammen, wie KI im GxP-Umfeld zu bewerten ist: Der Rapporteur der Drafting Group der EMA zum EU-GMP-Annex 22 erklärte im Dezember 2025 in Barcelona die Kritikalitätslogik des Entwurfs, ein National Expert der US FDA stellte im Juni 2026 in Boston klar, dass die Regeln bleiben, und im EMA-Expertenworkshop am 30. Juni 2026 antwortete die Industrie mit einer gemeinsamen Position. QFINITY hat alle drei verfolgt, in Barcelona und Boston vor Ort, beim EMA-Workshop in der öffentlichen Übertragung. Die Anlässe waren voneinander unabhängig, und doch landen alle bei denselben fünf Sätzen. Es ist die Linie, die wir im März 2026 auf dem GAMP D-A-CH Forum in Berlin selbst vorgetragen haben, mit der Frage: Wer widerspricht, wenn das System spricht?

Der Reihe nach: In Barcelona sprach der Rapporteur der Drafting Group, in Boston ein National Expert der FDA, im Workshop die Industrie gegenüber der EMA. Am Ende ordnen wir die drei Signale ein.

Barcelona, Dezember 2025: Wie die Drafting Group Kritikalität denkt

Auf der 2025 ISPE Pharma 4.0 Conference (9. und 10. Dezember 2025, Barcelona) erläuterte der Rapporteur der Drafting Group zum Annex 22, ein Vertreter der dänischen Arzneimittelbehörde, wie der Entwurf seinen Anwendungsbereich abgrenzt. Die Leitfrage lautete: Welche Wirkung hätte ein Fehler, und würde er entdeckt? Welche Technologie zum Einsatz kommt, spielt für diese Einordnung zunächst keine Rolle. Eine KI-gestützte Anwendung, deren Ergebnis ohnehin durch einen fachlichen Review geht, etwa bei Schulungsunterlagen oder SOP-Entwürfen, gilt danach als unkritisch. Der Workshop-Report der EMA vom Oktober 2026 macht die Wirksamkeit dieser Prüfung selbst zum Nachweisgegenstand; ein Review-Schritt allein entscheidet die Einstufung nicht. Eine Anwendung, deren Ergebnis ohne weiteren Review in die Qualitätsentscheidung eingeht, etwa in der Qualitätskontrolle oder in der automatischen visuellen Inspektion, gilt als kritisch.

Dann erläuterte der Rapporteur die ursprüngliche Regelungsabsicht des Entwurfs. Innerhalb des kritischen Bereichs nimmt der Entwurf bestimmte Technologien zunächst aus. Auf der Folie lag dieser Bereich oben rechts und wurde als "upper right-hand corner" zum geflügelten Wort unter Experten. Dynamische Systeme, die im Betrieb weiterlernen, bleiben ebenso aussen vor wie probabilistische Systeme, bei denen gleicher Input und gleiche Version nicht dasselbe Ergebnis erwarten lassen. Folgerichtig gilt das auch für grosse Sprachmodelle. Obwohl diese Sicht an Prozess und Systemdesign ansetzt, wurde sie am Ende an die Technologie gekoppelt. Das war einer der wesentlichen Diskussionspunkte in der gesamten Industrie. Dieselbe Botschaft hatte er mit denselben Folien wenige Tage zuvor bereits in der GAMP-D-A-CH-Community vorgetragen: am 4. Dezember 2025 auf der 2. GAMP-Konferenz "Künstliche Intelligenz trifft Pharma" in Mannheim. QFINITY war über ein Jahrzehnt an der Leitung der GAMP-D-A-CH-Community beteiligt und hat geholfen, die KI-Community im D-A-CH-Raum aufzubauen.

Der zweite Gedanke aus Barcelona betrifft den Nachweis. Ein trainiertes Modell lässt sich nicht mit einem deterministischen Einzeltest belegen. Sein Nachweis wechselt die Form: Testdaten, die selbst Anforderungen unterliegen, und Metriken, die für Kontrolle und Wirksamkeit tragen. Das ist die Denkweise der Data Scientists, und es ist zugleich das Prinzip des Qualitätsrisikomanagements: Entscheidung unter Unsicherheit. Beim Nachweis importiert Annex 22 damit keine fremde Logik in die GxP-Welt, sondern wendet die vorhandene auf Modelle an. Beim Anwendungsbereich zieht der Entwurf die Grenze dagegen a priori, anstatt die Zulässigkeit eines Modelltyps anhand der Risikobewertung zu beurteilen. An dieser Stelle setzte später die Industrie an.

Boston, Juni 2026: Eine FDA-Stimme sagt, die Regeln bleiben

Auf dem ISPE AI in Life Sciences Summit in Boston (22. und 23. Juni 2026) sprach Seneca Toms, National Expert Drugs der US FDA, über den Umgang der Industrie mit KI. Oliver Herrmann sass im Saal. Frank Henrichmann vertrat als Chair des GAMP Global Steering Committee die "Powered by GAMP"-Seite des Summits. Was an dem Vortrag überzeugte, war die Klarheit, mit der eine Behördenstimme die alten Grundsätze auf die neue Technik anwandte. Sichere und wirksame Produkte, beherrschte Prozesse, erkannte und gesteuerte Risiken, wissenschaftlich begründete Entscheidungen: Das galt vor KI, und es gilt danach. Die ISPE-Redaktion hat den Vortrag im August in einem iSpeak-Beitrag zusammengefasst. Sie weist ausdrücklich darauf hin, dass die Zusammenfassung von keiner der genannten Behörden geprüft wurde und keine offizielle Behördenposition wiedergibt. Die folgenden Gedanken geben wir daher als Reflexion des Vortrags wieder, nicht als Verlautbarung der FDA.

Vier Gedanken aus Boston greifen wir auf, weil sie für regulierte Unternehmen unmittelbar anwendbar sind. Die Prüftiefe richtet sich nach der Entscheidung, die ein System stützt: Ein Tool, das Besprechungsnotizen zusammenfasst, braucht eine andere Absicherung als ein System, das in Entscheidungen zu Produktqualität oder Patientensicherheit eingeht. Aufsicht setzt Verstehen voraus; wer ein Ergebnis freigibt, ohne es zu verstehen, übt keine Human Oversight aus. Das grösste Risiko sitzt im Vertrauen. Toms berichtete aus Inspektionen, in denen Systeme nicht versagt hatten, es fragte nur niemand mehr nach, weil sie seit Jahren liefen. Darin zeigt sich eine Beobachtung, die wir auch in Berlin beschrieben haben. Darauf kommen wir später zurück. Bei KI wiederholt sich dieses Muster, sobald Empfehlungen übernommen werden, weil sie bequem sind oder glaubwürdig wirken. Und das „current“ in cGMP verlangt, Schritt zu halten. Neue Werkzeuge werden am heutigen Stand gemessen, denn Papier, Altsysteme, Menschen und die heutigen Möglichkeiten zur Kontrolle von KI haben Grenzen.

„You can outsource a lot of things, but you cannot outsource your common sense.“ (Seneca Toms, US FDA, zitiert nach ISPE iSpeak, 24. August 2026)

EMA-Expertenworkshop, 30. Juni 2026: Die Industrie antwortet mit einer Stimme

Eine Woche nach Boston hörte die EMA einen Tag lang der Industrie zu. Im Expertenworkshop zum Entwurf des EU GMP Annex 22 trugen die von den Verbänden nominierten Experten ihre Positionen zu sechs von der EMA vorgegebenen Themenfeldern vor, von regulatorischen Wegen für adaptive Modelle über Human Oversight, Validierung und Lebenszyklus bis Cybersicherheit. Wir haben den öffentlich übertragenen ersten Tag vollständig verfolgt. Vorausgegangen war die Konsultation von 2025 mit 1.359 Kommentaren aus 79 Organisationen; der Ruf nach einem risikobasierten Ansatz war ihr deutlichster Schwerpunkt. Am zweiten, nicht öffentlichen Tag nahm die Drafting Group die Beiträge auf und setzte ihre Arbeit am Text fort. Die Aufteilung in einen öffentlichen und einen internen Tag war im Programm so vorgesehen. Das Signal liegt für uns im Ton der öffentlichen Stellungnahme, die die EMA danach abgab. Sie lässt erkennen, dass die vorgetragenen Ideen und Konzepte als hilfreich aufgenommen wurden. Auch ein ranghoher FDA-Vertreter lobte öffentlich Format und Dialog des Workshops.

Die Verbände waren gebeten worden, auch abweichende Auffassungen darzustellen. Das Ergebnis war dennoch eindeutig: Ihre Vorgehensmodelle stimmen überein und laufen auf die Auslegung eines qualitätsrisikobasierten Ansatzes hinaus. In der zentralen Frage des Anwendungsbereichs wich die Position der Industrie vom Entwurf ab. Der Entwurf schliesst dynamische, probabilistische und generative Modelle aus kritischen Anwendungen aus. Die Industrie hielt dagegen, kein Modelltyp sei per se unzulässig oder unbedenklich. Über die Zulässigkeit entscheide die Risikobewertung im konkreten Anwendungsfall. Bei der menschlichen Aufsicht schlug sie vor, den im Entwurf fest verankerten Human-in-the-Loop-Mechanismus durch ein Human-Oversight-Konzept mit mehreren Formen zu ersetzen. Die Spannweite reicht von der Freigabe jedes Outputs bis zur laufenden Überwachung mit Eingriff bei Ausnahmen. Welche Form angemessen ist, ergibt sich aus der Risikobewertung. Und bei den Guardrails zog die Industrie selbst die Grenze: Sie reduzieren Risiko, sie beseitigen es nicht, und eine Kontrolle, die Risiko senken soll, braucht einen eigenen Wirksamkeitsnachweis.

Aus Sicht von QFINITY war der stille Höhepunkt ein vorgetragenes Architekturbild: das KI-Subsystem aus Modell, Integrationscode und Guardrails als Teil innerhalb des computergestützten Systems, zu dem auch Prozess und Menschen gehören. Genau diese Einbettung ist die Architektur hinter unserer Validierung von KI im GxP-Umfeld: Das Modell wird verifiziert, das computergestützte Gesamtsystem wird im Prozess validiert.

Fünf Sätze, die alle drei teilen

Legt man die drei Anlässe nebeneinander, bleibt ein gemeinsamer Kern, den keine der Stimmen bestreitet:

1
Kritikalität wird aus dem Prozess abgeleitet und bemisst sich nach Wirkung und Entdeckbarkeit, nicht nach Technologie. Ob Wirkung und Entdeckbarkeit, Bedeutung der Entscheidung oder Risikobewertung im Anwendungsfall: Alle beschreiben dieselbe Achse. Die Eigenheiten generativer oder dynamischer Modelle gehören eine Ebene tiefer in die funktionale Risikobewertung, wo Guardrails als Kontrollen im Sinne des Qualitätsrisikomanagements ansetzen.
2
Human Oversight ist eine Fähigkeit. Barcelona macht den fachlichen Review zum Massstab der Kritikalität, die FDA-Stimme aus Boston verlangt Verstehen statt blosser Freigabe, die Industrie schlägt vor, den festen HITL-Mechanismus durch ein Human-Oversight-Konzept mit mehreren Formen zu ersetzen, und alle drei setzen voraus, dass Menschen wirksam prüfen können.
3
Der Nachweis wechselt zur statistischen Evidenz und bleibt GxP-Logik. Testdaten mit eigenen Anforderungen, Metriken, Konfidenz: Das ist die Form, in der ein Modell verifiziert wird, und sie folgt dem Prinzip der Entscheidung unter Unsicherheit.
4
Aufsicht gilt für den ganzen Lebenszyklus. Sie reicht von Planung und Design über die erste Verifizierung und die gesamte Betriebszeit bis zur Stilllegung. Dazu gehören das Nachjustieren der Aufsichtsform und das Monitoring. Vertrauen in ein System wird nicht einmal hergestellt und danach nie wieder geprüft.
5
Die Verantwortung bleibt beim Betreiber. Kein Modell und kein Dienstleister nimmt sie ab. Toms sagte es aus Sicht der FDA, die Industrie trägt es im Workshop als Konsens vor, und Ihre nächste Inspektion wird es voraussetzen.

Unsere Position aus Berlin: Wer widerspricht, wenn das System spricht?

Die fünf Sätze decken sich mit der Position, die Daniel Köpke und Oliver Herrmann auf dem 47. GAMP D-A-CH Forum am 11. März 2026 in Berlin vorgestellt haben. Sie stellten die Frage, was Human Oversight bedeutet, wenn Systeme intelligenter, komplexer und überzeugender werden. Der Ausgangspunkt war die Verantwortung: Ein Patient kennt weder SOPs noch Validierungspläne, er vertraut darauf, dass am Ende ein Mensch hinter der Qualität steht. Ein KI-befähigtes System kann Daten analysieren, Muster erkennen, Abweichungen klassifizieren und Entscheidungen vorbereiten, und es klingt dabei plausibel. Genau darin liegt das Risiko: Plausibilität ist kein Beleg für eine Prüfung. Sie kann eine Prüfung auslösen, sie kann sie nicht ersetzen, und sie macht Verantwortung nicht übertragbar.

Die grösste Gefahr für die QA ist deshalb nicht die KI. Es ist die schleichende Erosion sichtbarer Verantwortung: Klick für Klick, Bestätigung für Bestätigung, bis niemand mehr widerspricht. Die Aufgabe der QA verschiebt sich damit: Sie validiert nicht nur Systeme, sie gestaltet die Bedingungen, unter denen menschliches Urteil wirksam bleibt. Human Oversight gehört in Intended Use, Geschäftsprozess, Datenintegrität, risikobasierte Kontrollen und Lebenszyklus-Nachweise eingebettet, so dass Verantwortung nicht nur dokumentiert, sondern ausgeübt wird und ihre Wirksamkeit nachweisbar bleibt. Die ausführliche Fassung dieser Position steht im Beitrag Wer widerspricht, wenn das System spricht?

Welche Bedingungen müssen Sie heute schaffen, damit auch in drei Jahren jemand einer Empfehlung widerspricht, die das System bis dahin ohne Beanstandung geliefert hat?

Was daraus für Betreiber folgt

Die Konvergenz hat eine praktische Seite. Diese fünf Sätze tragen in jedem Ausgang der Überarbeitung, gleich, ob die EMA dem Risikoprinzip der Industrie folgt oder beim Ausschluss bestimmter Modellklassen bleibt. Ob Modelle, Kontrollen oder Nachweise anzupassen sind, hängt vom endgültigen Geltungsbereich und den konkreten Anforderungen ab. Die Nachweislogik des Entwurfs, von Intended Use über unabhängige Testdaten bis zum Monitoring, trägt in jedem Ausgang der Überarbeitung. Und sie trägt auch vor einer FDA-Inspektion, denn dort zählt, was Toms in Boston benannt hat: Verstehen, Risiko, Lebenszyklus, Verantwortung. Diese Nachweislogik ist ebenso nötig, damit die Systeme die erwartete Leistung erbringen und unabhängig vom KI-Label spürbar zu Entlastung und Wertschöpfung beitragen.

Der Einstieg ist die Kritikalitätsfrage: Welche KI-gestützten Anwendungen liefern Ergebnisse, die ohne weiteren Review in Qualitätsentscheidungen eingehen, die Patientensicherheit, Produktqualität oder Datenintegrität berühren? Daran schliesst die Wirksamkeit der Human Oversight an. Entscheidend ist dabei weniger, ob ein Review-Schritt dokumentiert ist, als ob die prüfende Person den Einsatzkontext versteht, die Grenzen des Systems kennt und widersprechen darf. Wie sich das prüfen lässt, beschreiben wir unter AI Governance und Human Oversight. Dazu gehört die Frage, ob Widerspruch im Betrieb noch vorkommt.

Wie es weitergeht

Für Annex 22 war zunächst ein Workshop-Report angekündigt. Der Nachtrag am Ende dieses Beitrags fasst den inzwischen veröffentlichten Report zusammen; danach wird eine überarbeitete Entwurfsfassung erwartet. Woran sich der finale Text entscheidet, haben wir auf unserer Annex-22-Seite in drei Fragen festgehalten und den Report daran gemessen. Bis zur überarbeiteten Fassung gilt der nüchterne Stand: Das computergestützte System wird nach Annex 11 validiert, das Qualitätsrisikomanagement gibt der Nachweistiefe die Orientierung, und Toms beschreibt aus Inspektionen keine andere Erwartung. Für QFINITY bestätigen die drei Signale aus Behörden und Industrie den Weg, den wir in Berlin vorgetragen haben: KI setzt die Linie von CSV und CSA fort. So haben wir es im Januar in Pharmaceutical Engineering beschrieben, und so lesen wir auch die Behörden- und Industriesignale dieses Jahres.

Zum Nachlesen: US FDA on AI, Critical Thinking, and the Enduring Principles of Quality (ISPE iSpeak, 24.08.2026)↗Human-in-the-Loop as an Illusion of Control? (Herrmann/Henrichmann, ISPE iSpeak, 04.09.2026)↗Chapter 4, Annex 11, Annex 22: Drei Entwürfe, ein Kontrollsystem (QFINITY)↗

Nachtrag vom 2. Oktober 2026. Der angekündigte Report liegt vor. Anfang Oktober 2026 hat die EMA den Workshop-Report (EMA/156789/2026)↗ veröffentlicht. Er hält fest, dass die Drafting Group eine Erweiterung des Geltungsbereichs auf dynamische, probabilistische und generative Modelle erörtert hat, gebunden an eine dokumentierte, risikobasierte Kontrollstrategie. Was der Report bestätigt und welche gemeinsamen Linien sich erkennen lassen, lesen Sie in unserem Beitrag EMA-Workshop-Report zu Annex 22; die drei Fragen auf unserer Annex-22-Seite sind auf den neuen Stand gebracht.

PI 006-4 Qualifizierung und Validierung - vom schrittweisen zum kontinuierlichen Nachweis - QFINITY

PIC/S hat die Empfehlungen zu Qualifizierung und Validierung neu gefasst: PI 006-4 ersetzt zum 1. Oktober 2026 den Stand von 2007. Der eigentliche Wandel liegt unter den Kapiteln: Validierung ist kein abgeschlossenes Ereignis mehr, sondern ein fortlaufend belegter Zustand. Genau das macht moderne Arbeitsweisen regulatorisch tragfähig, von der wissenschaftlich begründeten Chargenzahl in der Prozessvalidierung bis zur laufenden Verifikation im Betrieb. Wer die neue Fassung mit den Begriffen von 2007 liest, kann falsch abbiegen: Geltungsbereich und Terminologie haben sich verschoben. Computergestützte Systeme nimmt das Dokument ausdrücklich aus; sie gehören in ein anderes Regelwerk.

PI 006-4 "Recommendations on Qualification and Validation" ist die Empfehlung des Pharmaceutical Inspection Co-operation Scheme (PIC/S), dem neben den europäischen Inspektoraten auch die US-amerikanische FDA angehört, für Qualifizierung und Validierung in der pharmazeutischen Herstellung. Abgedeckt sind die Qualifizierung von Anlagen, Ausrüstung und Versorgungssystemen, die Prozess- und die Reinigungsvalidierung, die Validierung von Prüfmethoden sowie Sonderthemen wie die Verifikation des Transports und die Validierung der Verpackung fester Darreichungsformen. Sie tritt am 1. Oktober 2026 in Kraft, ersetzt die Fassung von 2007 und beschreibt, was Inspektorate über den Annex 15 hinaus erwarten. Eine Rechtsvorschrift ist sie nicht; als Leitfaden und Trainingsressource der Inspektoren und der Industrie prägt sie die Inspektionspraxis dennoch unmittelbar.

Warum ist PI 006-4 ein Paradigmenwechsel?

Aus vier eng umgrenzten Themen von 2007 ist ein Lebenszyklus-Leitfaden geworden. Besondere Aufmerksamkeit verdient die Sprache: Die Wörter sind geblieben, die Inhalte darunter sind gewandert. Je länger die eigene Validierungspraxis zurückreicht, desto vertrauter klingen die Begriffe; ihre Bedeutung von 2007 tragen sie aber nicht mehr.

1
Retrospektive Validierung: gestrichen. In der alten Welt der Rettungsanker für Altprozesse. PI 006-4 nennt sie "no longer considered an acceptable approach". Altprozesse brauchen Gap-Analyse, Risikobewertung und fortlaufende Verifikation nach heutigem Stand.
2
Periodische Revalidierung des Prozesses: existiert nicht mehr. Ongoing Process Verification "has taken the place of periodic revalidation". Der Zustand der Kontrolle wird fortlaufend nachgewiesen; der feste Intervall-Turnus entfällt. OPV ist dabei ein dokumentierter Nachweis dieses Zustands und damit mehr als Überwachung. Ersetzt wird die periodische Revalidierung, nicht die retrospektive Validierung: zwei verschiedene Streichungen.
3
Drei Chargen: ein Übergangsstand. PIC/S markiert den aktuellen Annex-15-Wortlaut selbst als "transitory". Die Chargenzahl wird wissenschaftlich begründet und risikobasiert festgelegt. Der Fahrplan ist öffentlich: Das gemeinsame Concept Paper von EMA und PIC/S von Anfang 2026 kündigt nach der laufenden Annex-15-Teilrevision eine umfassende Überarbeitung an.
4
IQ, OQ und PQ: nicht mehr der einzige Weg. Verifikationsbasierte Ansätze nach guter Ingenieurpraxis wie ASTM E2500 sind ausdrücklich genannt und können zur Anwendung kommen, wo die Umstände es rechtfertigen. Die klassische Qualifizierungskaskade bleibt der etablierte Weg; sie ist nur nicht mehr der einzige.
5
Der Transport wird verifiziert. Das Kapitel heißt bewusst "Verification of Transportation". Ein Transportweg ist beweglich und veränderlich; qualifiziert wird nur stabiles Gerät. PIC/S wählt die Nachweishandlung nach dem Gegenstand.

Dazu rückt die Statistik von der Kür zur Erwartung: Prozessfähigkeitsindizes, multivariate Verfahren und vorab definierte Bewertungen gehören risikoabhängig in die Protokolle, Fachexperten und Statistiker gemeinsam an den Tisch. Auch die Reinigungsvalidierung folgt der Bewegung: Der Umfang des Reinigungsprogramms richtet sich nach einer toxikologischen Risikobewertung, etwa auf Basis gesundheitsbasierter Expositionsgrenzwerte (HBEL); sie machen das tatsächliche Gefährdungspotenzial eines Wirkstoffs zum Maßstab dafür, wie streng gereinigt werden muss.

Steht die periodische Revalidierung noch in Ihrem Validierungsmasterplan?

An die Stelle der periodischen Revalidierung tritt die Ongoing Process Verification; ihre Anforderungen sind konkret. Nach der initialen Validierung, mit Aufnahme des Routinebetriebs, läuft die OPV bis zur Einstellung des Prozesses. Überwacht werden die Produktqualität und die risikobasiert festgelegten kritischen Parameter, dazu fließen Signale aus dem Qualitätssystem wie Abweichungen und Reklamationen ein; das Trending soll auch schleichende Veränderungen und besondere Variabilitätsursachen erkennen können. Berichtet wird regelmäßig, im Normalfall mindestens jährlich und wo immer möglich mit objektiven statistischen Werkzeugen wie dem Prozessfähigkeitsindex Cpk, der misst, wie zuverlässig der Prozess innerhalb seiner Spezifikationsgrenzen bleibt; jeder Bericht endet mit einem Urteil: Der Prozess ist im Zustand der Kontrolle, oder er ist es nicht. Der Aufwand skaliert mit dem Risiko, und die Berichte dürfen ausdrücklich als Referenz für den jährlichen Produktqualitätsbericht dienen. Für die meisten Unternehmen heißt das: Die Daten sind vorhanden. Doch wie steht es um die vorab definierten Kriterien und das regelmäßige dokumentierte Urteil?

Es gibt eine Prüffrage, mit der sich PI 006-4 ohne Stolperstellen lesen lässt: Was genau wird wogegen nachgewiesen? Wer je Nachweis den Gegenstand und den Referenzpunkt benennt, kann nicht falsch abbiegen. Dann ist die Verifikation des Transportwegs so folgerichtig wie die risikobasierte Chargenzahl. Wer dagegen nur die vertrauten Wörter mitnimmt, macht aus Verifikation Überwachung, aus dem fortlaufenden Nachweis einen Kalendereintrag und aus einer bedingten Erlaubnis eine freie Wahl. Dieselbe Denkökonomie steckt im Dokument selbst: Einmal erbrachte Nachweise werden referenziert; Wiederholungen entfallen.

  • FAT- und SAT-Ergebnisse können mit entsprechender Begründung den Umfang von IQ und OQ reduzieren.
  • PQ-Ergebnisse fließen in die Risikobewertung der Prozessvalidierung ein und können deren Umfang verkleinern.
  • Verbleibende kleinere Lücken der Validierung fängt die Ongoing Process Verification mit begründeten Zusatztests auf.

Was gilt für computergestützte Systeme?

Die zwei Prozesswelten

Computergestützte Systeme nimmt die Empfehlung ausdrücklich aus: Deren Validierung "is covered in the PIC/S GMP Guide Annex 11". Das ist eine bewusste Grenzziehung zwischen zwei Prozesswelten. Der Annex-15-Prozess transformiert Material zum Produkt; er ist anlagengebunden, wird mit der Zulassung eingereicht und über das Variations-Verfahren geändert. Der Annex-11-Prozess entsteht im Fachbereich und transformiert Informationen zu Records und Entscheidungen, vom ERP-Prozess bis zu Dokumentenlenkung, QMS-Workflows oder Reklamationsbearbeitung. Für ihn tragen die Werkzeuge der Produktionswelt nicht: Ein Abweichungsprozess kennt weder Chargen noch Prozessfähigkeitsindizes.

Anspruchsvoll wird es, wo beide Welten übereinanderliegen. Ein MES exekutiert den eingereichten Herstellprozess, ein LIMS steuert die Prüfungen nach den zugelassenen Methoden. Das System gehört unter Annex 11, sein Inhalt bleibt Zulassungswelt: die Prozesswelt des Annex 15. Wer die beiden nicht trennt, prüft doppelt oder lässt eine Lücke.

Drei Ebenen, ein Muster

Die Grenzziehung heißt allerdings nicht, dass die Systemwelt vom Paradigmenwechsel verschont bliebe. Sie ist ihm voraus. Annex 11 verlangt die Validierung computergestützter Systeme über den Lebenszyklus und ihre periodische Bewertung im Betrieb; der Revisionsentwurf von 2025 baut genau diese Betriebsphase aus: Reviews in risikobasierten Abständen prüfen, ob das System im validierten Zustand bleibt, und machen sichtbar, wenn ein System in Bewegung aus seinen definierten Parametern läuft. Der kommende KI-Annex 22 (Entwurf 2025) schreibt es konsequent fort: vorab definierte Metriken und Akzeptanzkriterien vor dem Test, im Betrieb regelmäßiges Performance-Monitoring des Modells und Überwachung des Eingabedatenraums auf Drift. Und der Entwurf des neuen Kapitels 4 (Dokumentation, 2025) zieht dieselbe Linie auf der Datenebene: Ein Data-Governance-System soll den gesamten Daten-Lebenszyklus abdecken, von der Entstehung über Verarbeitung und Archivierung bis zur Vernichtung. PI 006-4 selbst will Data Governance in allen Aspekten von Qualifizierung und Validierung berücksichtigt sehen.

Vom schrittweisen zum kontinuierlichen Nachweis - Treppe geht in eine Rampe über
Vom Schritt zum FlussDer Weg bleibt derselbe; aus einzelnen Stufen wird eine kontinuierliche Steigung.

Die Bewegung ist zudem transatlantisch, bis in die Autorenschaft: Die PIC/S-Arbeitsgruppe der Revision wurde zuletzt gemeinsam von der irischen HPRA und der US-amerikanischen FDA geleitet. Die FDA hat den Lebenszyklus-Gedanken bereits 2011 in ihrer Process-Validation-Guidance verankert; Stage 3 heißt dort Continued Process Verification, und der revidierte Annex 15 von 2015 hat diese Sicht übernommen. Auf der Systemseite verschiebt die FDA-Guidance zur Computer Software Assurance den Aufwand von der Dokumentation zur wirksamen Absicherung; formal gilt sie der Produktions- und QMS-Software der Medizinproduktehersteller, ihr Ansatz findet aber weit darüber hinaus Beachtung. Fünf Dokumente aus zwei Jahren tragen dieselbe Richtung: das Concept Paper von EMA und PIC/S zur Annex-15-Revision, PI 006-4, der Annex-11-Revisionsentwurf, der KI-Annex 22 und der Chapter-4-Entwurf. Produktionsebene, Systemebene und Datenebene konvergieren auf ein Muster: Qualität wird nicht mehr punktuell bewiesen, sondern fortlaufend nachgewiesen.

Und Ihre computergestützten Systeme: nach welchem Regelwerk validieren Sie?

QFINITY berät beide Welten und den Übergang. Viele unserer Kunden arbeiten heute mit den etablierten Methoden: klassische Validierungskampagnen, dokumentbasierte Nachweise, die Drei-Chargen-Logik. Diese Wege beraten wir weiterhin konsequent; sie bleiben regulatorisch zulässig, und welcher Weg passt, ist eine Frage des Reifegrads. Zunehmend und ebenso konsequent bieten wir die kontinuierlichen Vorgehen an: fortlaufende Verifikation im Betrieb, agile Softwareentwicklung mit belastbarer Prüfspur, risikobasiert begründete Chargenzahlen. Die ersten Anfragen dazu erreichen uns bereits. Entscheidend ist, wo die Organisation steht: QFINITY deckt alte, aktuelle und kommende Qualitätsstrategien ab und zieht die Grenze je Nachweis am Gegenstand. Was wird wogegen nachgewiesen? Aus der Antwort folgt, ob die Produktionsregeln gelten (Annex 15, bei der FDA 21 CFR 211 mit dem Process-Validation-Lifecycle) oder die Systemregeln (Annex 11, bei der FDA 21 CFR Part 11 und 211.68 sowie in der Medizinproduktewelt die CSA-Guidance), welche Prüftiefe angemessen ist und welche Nachweise Ihre Inspektion braucht; die liefern wir belastbar.

PIC/S PI 006-4: Recommendations on Qualification and Validation→Concept Paper zur Revision von Annex 15 (EMA und PIC/S, 2026)→