
QFINITY · Neuigkeiten · Einblicke & Events
Was die regulierte Qualität von morgen bewegt.
Fachbeiträge und Einordnungen aus unserer Arbeit zu GxP, Pharma, Qualitätsmanagement, GAMP und KI. Sie zeigen, was sich im regulierten Umfeld ändert, was es praktisch bedeutet und was bei uns im Unternehmen passiert.
Aktuelle Beiträge




Wie wird agentenbasierte KI im GxP-Umfeld möglich? QFINITY bringt die Governance-Perspektive in einen SAP-Expertenworkshop ein
Nachlese zum SAP-Expertenworkshop zu KI in regulierten Pharma-Prozessen, Walldorf, 18. August 2026.
Am 18. August 2026 hat QFINITY, vertreten durch Oliver Herrmann, die Governance-Perspektive in einen Expertenworkshop von SAP zu KI in regulierten Pharma-Prozessen eingebracht. Der Workshop folgte einem Ökosystem-Format: Ausgewählte Organisationen vertraten jeweils ihre Rolle, SAP als Anbieter, Merck für die regulierte Industrie, dazu Spezialisten für Governance, Validierung und Guardrails. Sie arbeiten an denselben Fragen, weil keine von ihnen sie allein lösen kann, und diese Fragen betreffen jeden im regulierten Umfeld. Wer trägt die Verantwortung, wenn agentenbasierte KI in GxP-Prozessen eingesetzt wird? Woran erkennt man, dass die Antwort belastbar ist?
Was der Hersteller liefert und was beim Kunden bleibt
QFINITYs Beitrag folgte einem Grundsatz: Der Softwarehersteller liefert die technische Fähigkeit, eingebettet in eine GxP-geprägte Governance, die zu den Governance-Systemen der Anwender passt. Was kein Hersteller liefern kann, ist die regulatorische Verantwortung jedes einzelnen Kunden. Sie entsteht auf der Kundenseite: in der eigenen Governance, in der Validierung der Systeme im eigenen Prozess, in den eigenen Kontrollen.
Die strukturelle Herausforderung dahinter ist eine Asymmetrie. Eine Produkt-Governance trifft auf viele Governance-Systeme regulierter Anwender, und jeder dieser Anwender trägt seine GxP-Verantwortung selbst, auch für ausgelagerte Tätigkeiten, wie es Annex 11 im Abschnitt zu Lieferanten und Dienstleistern vorsieht. Diese Asymmetrie ist strukturell, und Harmonisierung allein löst sie nicht auf. Es braucht definierte Schnittstellen, an denen Evidenz die Grenze überquert: Modelländerungen, Herkunft der Trainingsdaten, Monitoring-Signale, Audit-Rechte bis in die Lieferkette der Modell-Provider.
Die Fähigkeit wird geliefert. Die Verantwortung nicht.
Der Mensch bleibt in der Verantwortung
Human Oversight heißt nicht, dass ein Mensch beteiligt ist. Die Prüffrage lautet: Kann er noch eingreifen und stoppen? Das gilt auf jeder Ebene, bis hin zu den Rollen, die persönlich verantworten, was freigegeben wird. Drei Fragen stellen wir deshalb an jedes agentenbasierte System, unabhängig vom konkreten Anbieter:
In unserem ISPE-iSpeak-Beitrag Human-in-the-Loop as an Illusion of Control? erläutern wir, warum die Beteiligung eines Menschen allein noch keine Kontrolle ist.
Die Messlatte heißt Patientensicherheit
Die eigentliche Messlatte unserer Industrie betrifft jede Aktivität: Patientensicherheit, Produktqualität und Datenintegrität. Audits sind dabei einer von vielen Kontrollbausteinen. Gute AI Governance ist wenig glamourös, geradezu unspannend. Statt eines dramatischen Stopps zeigt sie sich darin, dass Entscheidungen sorgfältig abgewogen wurden, bevor Risiken eintreten. Die Frage, die wir von einem Auditor erwarten, lautet deshalb nicht mehr, ob eine KI-Richtlinie existiert, sondern: „Zeigen Sie mir, an welcher Stelle Ihre AI Governance eine Entscheidung maßgeblich geprägt hat.“ Auf diese Frage muss die Architektur heute vorbereitet werden.
Warum wir hier mitreden
Diese Fragen sind für QFINITY nicht neu. Lieferantenverantwortung, Validierungsevidenz und menschliche Verantwortlichkeit sind seit 22 Jahren unser Tagesgeschäft, für 200 Kunden in über 20 Ländern, im Kernteam der GAMP 5 Second Edition und in den Autorenteams von GAMP Good Practice Guides, vom RDI-Guide zur Datenintegrität bis zum eClinical-Guide. Neu ist der Kontext, denn KI kommt jetzt in den regulierten Prozessen an. Unsere Rolle dabei ist die des Übersetzers zwischen den Erwartungen der regulierten Anwender und denen des Softwareherstellers.
Wie es weitergeht
Die Diskussion läuft weiter. Im Oktober tragen Oliver Herrmann und Martin Heitmann das Thema auf das ISPE Annual Meeting & Expo in Washington, D.C., mit ihrem Vortrag über Progressive QA für GxP-Prozesse mit KI-Einsatz am 21. Oktober. Im Dezember stehen QFINITY und Merck erneut gemeinsam auf der Bühne. Auf der 19. Offiziellen GAMP 5 Konferenz in Mannheim moderieren Oliver Herrmann und Alexander Kunz (Merck) die Diskussionsrunde „CSV am Wendepunkt: Ist unsere Validierung bereit für die digitale Realität?“
Wenn Sie sich fragen, welche Rolle Sie in diesem Netzwerk spielen und wie Ihre eigene Governance der Audit-Frage standhält, dann ist das ein Gespräch, das wir gern führen.
Wer widerspricht, wenn das System spricht?
Nachlese zum 47. GAMP D-A-CH Forum, Berlin, 11. März 2026.
Auf dem 47. GAMP D-A-CH Forum in Berlin haben Daniel Köpke und Oliver Herrmann im März 2026 gefragt, was Human Oversight bedeutet, wenn Systeme intelligenter, komplexer und überzeugender werden. Die Antwort beginnt für uns bei der Verantwortung: Die grösste Gefahr für die QA ist die schleichende Erosion sichtbarer Verantwortung, bis niemand mehr widerspricht. Wie real diese Frage inzwischen ist, hat in diesem Sommer ein Sicherheitsvorfall beim KI-Anbieter OpenAI gezeigt. Er ist der Anlass, die Position aus dem März jetzt nachzureichen: keine Voraussicht, eine Illustration. Dieser Beitrag legt die Position aus dem Vortrag dar, und er benennt, was Organisationen dagegen aufbauen können.
Warum kommt diese Nachlese jetzt?
Am 26. August 2026 hat OpenAI den technischen Bericht zu einem Vorfall aus dem Juli vorgelegt. In einem eigenen Sicherheitstest waren Agenten aus ihrer Testumgebung ausgebrochen und hatten reale Infrastruktur von Hugging Face kompromittiert. Ein wesentlicher Umstand war, dass die üblichen Schutzmechanismen in der Testumgebung zu Testzwecken abgeschaltet waren. Im produktiven Betrieb wären sie dagegen vorgesehen. Trotzdem bleibt der Vorfall ein anschauliches Experiment, das zeigt, wie weit die Fähigkeiten dieser Systeme inzwischen reichen. Ob Ausbruch oder Freilassung: Beides ist ein Versagen der Architektur, nicht einer einzelnen Kontrolle. Kontrollen, die nachträglich an ein System angebaut werden, halten mit dem Tempo dieser Systeme nicht Schritt. Kontrollierbarkeit muss angelegt sein, bevor das System spricht. Der Vorfall geschah weit ausserhalb der GxP-Welt. Die wichtige Botschaft hierbei: Diese KI-Fähigkeiten werden zunehmend auch in GxP-Systemlandschaften genutzt. Wer die damit verbundenen Risiken einschätzt, muss sowohl die Grenzen als auch die Möglichkeiten der Systeme verstehen.
Der Ausgangspunkt ist die Verantwortung
Jeder Mensch hat ein Gesicht und eine Stimme. Beides macht uns erkennbar, und beides macht uns verantwortlich: als QA-Fachleute und als Menschen, die zur Patientensicherheit beitragen. Ein Patient kennt unsere Systeme nicht. Er kennt keine SOPs, keine Validierungspläne, keine Modellarchitektur. Er vertraut darauf, dass am Ende ein Mensch hinter der Qualität steht.
Die Verbindung zur KI liegt im Übergang von Daten zu Entscheidungen. Ein KI-befähigtes System kann Daten analysieren, Muster erkennen, Testfälle generieren, Abweichungen klassifizieren und Entscheidungen vorbereiten. Und es klingt dabei plausibel, oft sogar sehr plausibel.
Alles dokumentiert, alles konform, und niemand versteht, warum
In Berlin haben wir mit einer Szene begonnen. Ein System empfiehlt die Freigabe. Ein zweites hat die Daten geprüft. Ein drittes hat die Anomalie als akzeptabel klassifiziert. Alles dokumentiert, alles nachvollziehbar, alles konform. Und kein Mensch hat wirklich verstanden, warum.
Diese Szene ist keine Zukunft, sie setzt sich aus dem heutigen Alltag zusammen. Ein System generiert 847 Testfälle, und der Tester prüft den Output. Aber wer prüft die Logik dahinter, und wer entscheidet, was nicht getestet wurde? Ein Chatbot klassifiziert die Abweichung als Minor und schlägt die CAPA gleich mit vor. Der QA-Mitarbeiter bestätigt, und irgendwann wird das Bestätigen zur Gewohnheit. Ein autonomes Monitoring meldet keinen Trend. Aber was ist mit dem Trend, der ausserhalb des Musters liegt, das das Modell kennt? Stille ist keine Aussage. Stille ist eine Annahme.
Plausibilität ist kein Beleg für eine Prüfung
Darin liegt das zentrale Risiko jedes Human-in-the-Loop-Aufbaus. Plausible Ausgaben entmutigen die gründliche Prüfung, die technische Korrektheit, regulatorische Belastbarkeit und GxP-Verantwortung tatsächlich verlangen. Plausibilität kann eine Prüfung auslösen. Ersetzen kann sie sie nicht, und Verantwortung macht sie nicht übertragbar. Plausibel heisst: Es könnte stimmen. Richtig heisst: Wir haben es geprüft und verstanden. Das ist kein kleiner Unterschied, das ist der Unterschied.
Ein System trägt keine regulatorische Verantwortung. Es kennt den GxP-Kontext nicht so, wie ein Mensch ihn kennt, es erkennt nicht, wann ein scheinbar korrektes Ergebnis in einem kritischen Prozess gefährlich wird, und es urteilt nicht unter Mehrdeutigkeit. All das bleibt beim Menschen. Technische Kontrollmechanismen, in der Debatte oft Guardrails genannt, können Menschen dabei unterstützen, diese Verantwortung wahrzunehmen. Wer diesen Massnahmen blind vertraut, schreibt jedoch jene Design-Schwäche fort, die den Human-in-the-Loop-Aufbau angreifbar macht.
Die schleichende Erosion sichtbarer Verantwortung
Die Gefahr kommt leise. Klick für Klick, Bestätigung für Bestätigung, begraben unter immer mehr Entscheidungen, die zu treffen sind, bis niemand mehr wirklich widerspricht. Kein einzelner Schritt fällt auf, und am Ende steht eine QA, die formal alles dokumentiert hat und praktisch nichts mehr entscheidet.
Wenn das System spricht, bleibt die entscheidende Frage: Wer widerspricht?
Drei Regelwerke, eine Richtung
In Berlin haben wir diese Frage an Regelwerken gespiegelt, die unabhängig voneinander entstanden sind und dieselbe Erwartung tragen. Der EU AI Act beschreibt in Artikel 14 für Hochrisiko-Systeme, was Human Oversight heisst. Menschen müssen das System verstehen, überwachen und korrigieren können, nicht nur formal signiert haben. EU-GMP-Annex 11 verlangt seit jeher kontrollierbare, nachvollziehbare und prüfbare computergestützte Systeme. Er wurde vor generativer KI geschrieben, und er gilt trotzdem. Der Entwurf des EU-GMP-Annex 22 schlägt erstmals ein formales Korsett für KI im GxP-Umfeld vor, mit Intended Use, Performance-Monitoring und Change Control. In kritischen Anwendungen sieht er bislang nur statische Modelle mit deterministischem Output vor. Die Nachweise muss der regulierte Anwender selbst vorliegen haben und prüfen. Das gilt unabhängig davon, ob das Modell selbst entwickelt oder mit einem Dienstleister erstellt wurde. Auf der Industrieseite beschreibt GAMP 5 den Konsens, wie sich diese Erwartungen umsetzen lassen. Alle zeigen in dieselbe Richtung. Die Kontrolle bleibt beim Menschen.
Die Rolle der QA verschiebt sich
Eine QA, die diese Frage beantworten will, gestaltet die Bedingungen, unter denen menschliches Urteil wirksam bleibt. Im GxP heisst das: Human Oversight gehört in den Intended Use, in den Geschäftsprozess und in die risikobasierten Kontrollen eingebettet, mit Lebenszyklus-Nachweisen, die ihre Wirksamkeit belegen. Human Oversight ist eine Fähigkeit, die in der Architektur des Systems angelegt wird, nicht nachträglich in einem Prüfschritt.
In Berlin haben wir diese Rolle in vier Bildern beschrieben. Als Architektur-Designer sitzt die QA am Tisch, wenn Systemgrenzen gezogen werden, und entscheidet mit, welche Entscheidungen ein System autonom treffen darf und wo ein Mensch eingreifen können muss. Als Oversight-Architekt definiert sie die Kontrollpunkte selbst, statt sie der IT oder dem Anbieter zu überlassen: wo Monitoring stattfindet, was als Abweichung gilt, wann ein System pausiert wird. Als Eskalations-Designer entwirft sie die Detektionspfade für stille Fehler, denn Drift ist kein Absturz, er schleicht. Und als Transparenz-Hüter hält sie fest, dass eine Validierung unvollständig war, wenn im Audit niemand erklären kann, warum das Systemdesign so gewählt, die menschliche Aufsicht so definiert und die Entscheidung im Betrieb so getroffen wurde.
Der Satz, auf den der Vortrag zulief, gilt unverändert. Zukunftssichere QA validiert nicht nur Systeme. Sie validiert, dass der Mensch entscheidungsfähig bleibt.
Und sie braucht Menschen, die prüfen können. Vier Bedingungen entscheiden darüber, ob Widerspruch im Alltag vorkommt:
Organisationen müssen Human Oversight so gestalten, dass Verantwortung im Alltag ausgeübt wird und ihre Wirksamkeit nachweisbar bleibt. Und die Zuordnung gehört dokumentiert. Nicht das System hat entschieden. Ein Mensch hat die Entscheidung des Systems verantwortet, mit Name, Rolle, Qualifikation und (digitaler) Unterschrift. Im Audit gibt es keine Zeile für das Modell. Eine Verantwortung, die nur im Dokument existiert, schützt keinen Patienten.
Drei unterstützende Stimmen, ein gemeinsamer Kern
Seit dem Vortrag ist diese Position nicht allein geblieben. Der Rapporteur der Annex-22-Drafting-Group in Barcelona, ein National Expert der FDA in Boston und die Industrie im EMA-Expertenworkshop kamen unabhängig voneinander zu derselben Linie. Die Zusammenschau steht im Beitrag Drei Signale, eine Linie. Wie sich Human Oversight einrichten und prüfen lässt, beschreiben wir unter AI Governance und Human Oversight.
Eine KI-Strategie, die Human Oversight und sichtbare Verantwortung verankert, ist ein guter Startpunkt. Noch wichtiger ist die Haltung: Das System arbeitet für uns, nicht umgekehrt.
Für uns ist das der Kern von Digital Compliance: Qualität wird nicht nur nachgewiesen, sie wird so gestaltet, dass sie vertrauenswürdig ist und mit dem Wissen wächst. Vertrauen hat ein Gesicht und eine Stimme. Unsere Aufgabe ist, dass beide nicht in unseren Systemen verschwinden.
Zum Nachlesen: Rückblick: GAMP D-A-CH in Berlin (ISPE D-A-CH, 11.03.2026)↗OpenAI: Bericht zum Hugging-Face-Sicherheitsvorfall (26.08.2026)↗
Drei Signale, eine Linie: KI im GxP-Umfeld zwischen Barcelona, Boston und dem EMA-Workshop
Innerhalb von sieben Monaten kamen drei Signale zusammen, wie KI im GxP-Umfeld zu bewerten ist: Der Rapporteur der Drafting Group der EMA zum EU-GMP-Annex 22 erklärte im Dezember 2025 in Barcelona die Kritikalitätslogik des Entwurfs, ein National Expert der US FDA stellte im Juni 2026 in Boston klar, dass die Regeln bleiben, und im EMA-Expertenworkshop am 30. Juni 2026 antwortete die Industrie mit einer gemeinsamen Position. QFINITY hat alle drei verfolgt, in Barcelona und Boston vor Ort, beim EMA-Workshop in der öffentlichen Übertragung. Die Anlässe waren voneinander unabhängig, und doch landen alle bei denselben fünf Sätzen. Es ist die Linie, die wir im März 2026 auf dem GAMP D-A-CH Forum in Berlin selbst vorgetragen haben, mit der Frage: Wer widerspricht, wenn das System spricht?
Der Reihe nach: In Barcelona sprach der Rapporteur der Drafting Group, in Boston ein National Expert der FDA, im Workshop die Industrie gegenüber der EMA. Am Ende ordnen wir die drei Signale ein.
Barcelona, Dezember 2025: Wie die Drafting Group Kritikalität denkt
Auf der 2025 ISPE Pharma 4.0 Conference (9. und 10. Dezember 2025, Barcelona) erläuterte der Rapporteur der Drafting Group zum Annex 22, ein Vertreter der dänischen Arzneimittelbehörde, wie der Entwurf seinen Anwendungsbereich abgrenzt. Die Leitfrage lautete: Welche Wirkung hätte ein Fehler, und würde er entdeckt? Welche Technologie zum Einsatz kommt, spielt für diese Einordnung zunächst keine Rolle. Eine KI-gestützte Anwendung, deren Ergebnis ohnehin durch einen fachlichen Review geht, etwa bei Schulungsunterlagen oder SOP-Entwürfen, gilt danach als unkritisch. Der Workshop-Report der EMA vom Oktober 2026 macht die Wirksamkeit dieser Prüfung selbst zum Nachweisgegenstand; ein Review-Schritt allein entscheidet die Einstufung nicht. Eine Anwendung, deren Ergebnis ohne weiteren Review in die Qualitätsentscheidung eingeht, etwa in der Qualitätskontrolle oder in der automatischen visuellen Inspektion, gilt als kritisch.
Dann erläuterte der Rapporteur die ursprüngliche Regelungsabsicht des Entwurfs. Innerhalb des kritischen Bereichs nimmt der Entwurf bestimmte Technologien zunächst aus. Auf der Folie lag dieser Bereich oben rechts und wurde als "upper right-hand corner" zum geflügelten Wort unter Experten. Dynamische Systeme, die im Betrieb weiterlernen, bleiben ebenso aussen vor wie probabilistische Systeme, bei denen gleicher Input und gleiche Version nicht dasselbe Ergebnis erwarten lassen. Folgerichtig gilt das auch für grosse Sprachmodelle. Obwohl diese Sicht an Prozess und Systemdesign ansetzt, wurde sie am Ende an die Technologie gekoppelt. Das war einer der wesentlichen Diskussionspunkte in der gesamten Industrie. Dieselbe Botschaft hatte er mit denselben Folien wenige Tage zuvor bereits in der GAMP-D-A-CH-Community vorgetragen: am 4. Dezember 2025 auf der 2. GAMP-Konferenz "Künstliche Intelligenz trifft Pharma" in Mannheim. QFINITY war über ein Jahrzehnt an der Leitung der GAMP-D-A-CH-Community beteiligt und hat geholfen, die KI-Community im D-A-CH-Raum aufzubauen.
Der zweite Gedanke aus Barcelona betrifft den Nachweis. Ein trainiertes Modell lässt sich nicht mit einem deterministischen Einzeltest belegen. Sein Nachweis wechselt die Form: Testdaten, die selbst Anforderungen unterliegen, und Metriken, die für Kontrolle und Wirksamkeit tragen. Das ist die Denkweise der Data Scientists, und es ist zugleich das Prinzip des Qualitätsrisikomanagements: Entscheidung unter Unsicherheit. Beim Nachweis importiert Annex 22 damit keine fremde Logik in die GxP-Welt, sondern wendet die vorhandene auf Modelle an. Beim Anwendungsbereich zieht der Entwurf die Grenze dagegen a priori, anstatt die Zulässigkeit eines Modelltyps anhand der Risikobewertung zu beurteilen. An dieser Stelle setzte später die Industrie an.
Boston, Juni 2026: Eine FDA-Stimme sagt, die Regeln bleiben
Auf dem ISPE AI in Life Sciences Summit in Boston (22. und 23. Juni 2026) sprach Seneca Toms, National Expert Drugs der US FDA, über den Umgang der Industrie mit KI. Oliver Herrmann sass im Saal. Frank Henrichmann vertrat als Chair des GAMP Global Steering Committee die "Powered by GAMP"-Seite des Summits. Was an dem Vortrag überzeugte, war die Klarheit, mit der eine Behördenstimme die alten Grundsätze auf die neue Technik anwandte. Sichere und wirksame Produkte, beherrschte Prozesse, erkannte und gesteuerte Risiken, wissenschaftlich begründete Entscheidungen: Das galt vor KI, und es gilt danach. Die ISPE-Redaktion hat den Vortrag im August in einem iSpeak-Beitrag zusammengefasst. Sie weist ausdrücklich darauf hin, dass die Zusammenfassung von keiner der genannten Behörden geprüft wurde und keine offizielle Behördenposition wiedergibt. Die folgenden Gedanken geben wir daher als Reflexion des Vortrags wieder, nicht als Verlautbarung der FDA.
Vier Gedanken aus Boston greifen wir auf, weil sie für regulierte Unternehmen unmittelbar anwendbar sind. Die Prüftiefe richtet sich nach der Entscheidung, die ein System stützt: Ein Tool, das Besprechungsnotizen zusammenfasst, braucht eine andere Absicherung als ein System, das in Entscheidungen zu Produktqualität oder Patientensicherheit eingeht. Aufsicht setzt Verstehen voraus; wer ein Ergebnis freigibt, ohne es zu verstehen, übt keine Human Oversight aus. Das grösste Risiko sitzt im Vertrauen. Toms berichtete aus Inspektionen, in denen Systeme nicht versagt hatten, es fragte nur niemand mehr nach, weil sie seit Jahren liefen. Darin zeigt sich eine Beobachtung, die wir auch in Berlin beschrieben haben. Darauf kommen wir später zurück. Bei KI wiederholt sich dieses Muster, sobald Empfehlungen übernommen werden, weil sie bequem sind oder glaubwürdig wirken. Und das „current“ in cGMP verlangt, Schritt zu halten. Neue Werkzeuge werden am heutigen Stand gemessen, denn Papier, Altsysteme, Menschen und die heutigen Möglichkeiten zur Kontrolle von KI haben Grenzen.
„You can outsource a lot of things, but you cannot outsource your common sense.“ (Seneca Toms, US FDA, zitiert nach ISPE iSpeak, 24. August 2026)
EMA-Expertenworkshop, 30. Juni 2026: Die Industrie antwortet mit einer Stimme
Eine Woche nach Boston hörte die EMA einen Tag lang der Industrie zu. Im Expertenworkshop zum Entwurf des EU GMP Annex 22 trugen die von den Verbänden nominierten Experten ihre Positionen zu sechs von der EMA vorgegebenen Themenfeldern vor, von regulatorischen Wegen für adaptive Modelle über Human Oversight, Validierung und Lebenszyklus bis Cybersicherheit. Wir haben den öffentlich übertragenen ersten Tag vollständig verfolgt. Vorausgegangen war die Konsultation von 2025 mit 1.359 Kommentaren aus 79 Organisationen; der Ruf nach einem risikobasierten Ansatz war ihr deutlichster Schwerpunkt. Am zweiten, nicht öffentlichen Tag nahm die Drafting Group die Beiträge auf und setzte ihre Arbeit am Text fort. Die Aufteilung in einen öffentlichen und einen internen Tag war im Programm so vorgesehen. Das Signal liegt für uns im Ton der öffentlichen Stellungnahme, die die EMA danach abgab. Sie lässt erkennen, dass die vorgetragenen Ideen und Konzepte als hilfreich aufgenommen wurden. Auch ein ranghoher FDA-Vertreter lobte öffentlich Format und Dialog des Workshops.
Die Verbände waren gebeten worden, auch abweichende Auffassungen darzustellen. Das Ergebnis war dennoch eindeutig: Ihre Vorgehensmodelle stimmen überein und laufen auf die Auslegung eines qualitätsrisikobasierten Ansatzes hinaus. In der zentralen Frage des Anwendungsbereichs wich die Position der Industrie vom Entwurf ab. Der Entwurf schliesst dynamische, probabilistische und generative Modelle aus kritischen Anwendungen aus. Die Industrie hielt dagegen, kein Modelltyp sei per se unzulässig oder unbedenklich. Über die Zulässigkeit entscheide die Risikobewertung im konkreten Anwendungsfall. Bei der menschlichen Aufsicht schlug sie vor, den im Entwurf fest verankerten Human-in-the-Loop-Mechanismus durch ein Human-Oversight-Konzept mit mehreren Formen zu ersetzen. Die Spannweite reicht von der Freigabe jedes Outputs bis zur laufenden Überwachung mit Eingriff bei Ausnahmen. Welche Form angemessen ist, ergibt sich aus der Risikobewertung. Und bei den Guardrails zog die Industrie selbst die Grenze: Sie reduzieren Risiko, sie beseitigen es nicht, und eine Kontrolle, die Risiko senken soll, braucht einen eigenen Wirksamkeitsnachweis.
Aus Sicht von QFINITY war der stille Höhepunkt ein vorgetragenes Architekturbild: das KI-Subsystem aus Modell, Integrationscode und Guardrails als Teil innerhalb des computergestützten Systems, zu dem auch Prozess und Menschen gehören. Genau diese Einbettung ist die Architektur hinter unserer Validierung von KI im GxP-Umfeld: Das Modell wird verifiziert, das computergestützte Gesamtsystem wird im Prozess validiert.
Fünf Sätze, die alle drei teilen
Legt man die drei Anlässe nebeneinander, bleibt ein gemeinsamer Kern, den keine der Stimmen bestreitet:
Unsere Position aus Berlin: Wer widerspricht, wenn das System spricht?
Die fünf Sätze decken sich mit der Position, die Daniel Köpke und Oliver Herrmann auf dem 47. GAMP D-A-CH Forum am 11. März 2026 in Berlin vorgestellt haben. Sie stellten die Frage, was Human Oversight bedeutet, wenn Systeme intelligenter, komplexer und überzeugender werden. Der Ausgangspunkt war die Verantwortung: Ein Patient kennt weder SOPs noch Validierungspläne, er vertraut darauf, dass am Ende ein Mensch hinter der Qualität steht. Ein KI-befähigtes System kann Daten analysieren, Muster erkennen, Abweichungen klassifizieren und Entscheidungen vorbereiten, und es klingt dabei plausibel. Genau darin liegt das Risiko: Plausibilität ist kein Beleg für eine Prüfung. Sie kann eine Prüfung auslösen, sie kann sie nicht ersetzen, und sie macht Verantwortung nicht übertragbar.
Die grösste Gefahr für die QA ist deshalb nicht die KI. Es ist die schleichende Erosion sichtbarer Verantwortung: Klick für Klick, Bestätigung für Bestätigung, bis niemand mehr widerspricht. Die Aufgabe der QA verschiebt sich damit: Sie validiert nicht nur Systeme, sie gestaltet die Bedingungen, unter denen menschliches Urteil wirksam bleibt. Human Oversight gehört in Intended Use, Geschäftsprozess, Datenintegrität, risikobasierte Kontrollen und Lebenszyklus-Nachweise eingebettet, so dass Verantwortung nicht nur dokumentiert, sondern ausgeübt wird und ihre Wirksamkeit nachweisbar bleibt. Die ausführliche Fassung dieser Position steht im Beitrag Wer widerspricht, wenn das System spricht?
Welche Bedingungen müssen Sie heute schaffen, damit auch in drei Jahren jemand einer Empfehlung widerspricht, die das System bis dahin ohne Beanstandung geliefert hat?
Was daraus für Betreiber folgt
Die Konvergenz hat eine praktische Seite. Diese fünf Sätze tragen in jedem Ausgang der Überarbeitung, gleich, ob die EMA dem Risikoprinzip der Industrie folgt oder beim Ausschluss bestimmter Modellklassen bleibt. Ob Modelle, Kontrollen oder Nachweise anzupassen sind, hängt vom endgültigen Geltungsbereich und den konkreten Anforderungen ab. Die Nachweislogik des Entwurfs, von Intended Use über unabhängige Testdaten bis zum Monitoring, trägt in jedem Ausgang der Überarbeitung. Und sie trägt auch vor einer FDA-Inspektion, denn dort zählt, was Toms in Boston benannt hat: Verstehen, Risiko, Lebenszyklus, Verantwortung. Diese Nachweislogik ist ebenso nötig, damit die Systeme die erwartete Leistung erbringen und unabhängig vom KI-Label spürbar zu Entlastung und Wertschöpfung beitragen.
Der Einstieg ist die Kritikalitätsfrage: Welche KI-gestützten Anwendungen liefern Ergebnisse, die ohne weiteren Review in Qualitätsentscheidungen eingehen, die Patientensicherheit, Produktqualität oder Datenintegrität berühren? Daran schliesst die Wirksamkeit der Human Oversight an. Entscheidend ist dabei weniger, ob ein Review-Schritt dokumentiert ist, als ob die prüfende Person den Einsatzkontext versteht, die Grenzen des Systems kennt und widersprechen darf. Wie sich das prüfen lässt, beschreiben wir unter AI Governance und Human Oversight. Dazu gehört die Frage, ob Widerspruch im Betrieb noch vorkommt.
Wie es weitergeht
Für Annex 22 war zunächst ein Workshop-Report angekündigt. Der Nachtrag am Ende dieses Beitrags fasst den inzwischen veröffentlichten Report zusammen; danach wird eine überarbeitete Entwurfsfassung erwartet. Woran sich der finale Text entscheidet, haben wir auf unserer Annex-22-Seite in drei Fragen festgehalten und den Report daran gemessen. Bis zur überarbeiteten Fassung gilt der nüchterne Stand: Das computergestützte System wird nach Annex 11 validiert, das Qualitätsrisikomanagement gibt der Nachweistiefe die Orientierung, und Toms beschreibt aus Inspektionen keine andere Erwartung. Für QFINITY bestätigen die drei Signale aus Behörden und Industrie den Weg, den wir in Berlin vorgetragen haben: KI setzt die Linie von CSV und CSA fort. So haben wir es im Januar in Pharmaceutical Engineering beschrieben, und so lesen wir auch die Behörden- und Industriesignale dieses Jahres.
Zum Nachlesen: US FDA on AI, Critical Thinking, and the Enduring Principles of Quality (ISPE iSpeak, 24.08.2026)↗Human-in-the-Loop as an Illusion of Control? (Herrmann/Henrichmann, ISPE iSpeak, 04.09.2026)↗Chapter 4, Annex 11, Annex 22: Drei Entwürfe, ein Kontrollsystem (QFINITY)↗
Nachtrag vom 2. Oktober 2026. Der angekündigte Report liegt vor. Anfang Oktober 2026 hat die EMA den Workshop-Report (EMA/156789/2026)↗ veröffentlicht. Er hält fest, dass die Drafting Group eine Erweiterung des Geltungsbereichs auf dynamische, probabilistische und generative Modelle erörtert hat, gebunden an eine dokumentierte, risikobasierte Kontrollstrategie. Was der Report bestätigt und welche gemeinsamen Linien sich erkennen lassen, lesen Sie in unserem Beitrag EMA-Workshop-Report zu Annex 22; die drei Fragen auf unserer Annex-22-Seite sind auf den neuen Stand gebracht.