FOS 63 Verlässliche Infrastrukturen für die Wissenschaft
LINKS UND HINTERGRÜNDE:
EOSC Node Germany
NFDI: Nationale Forschungsdateninfrastruktur
EOSC: European Open Science Cloud
The Future is Open Science – Folge 63: Verlässliche Infrastrukturen für die Wissenschaft
Dr. Doreen Siegfried
Leitung Marketing und Public Relations, ZBW – Leibniz-Informationszentrum Wirtschaft
Professor Dr. Klaus Tochtermann
Präsident der EOSC Association, Mitglied des wissenschaftlichen Senats der Nationalen Forschungsdateninfrastruktur, Direktor der ZBW – Leibniz-Informationszentrum Wirtschaft
[00:00:00] Intro
[00:00:02] Klaus Tochtermann:
Wenn es nicht geht, wird quasi Forschung und damit auch Innovation einfach verzögert. Wenn also eine Infrastruktur ein halbes Jahr ausfällt und die Daten nicht zugänglich sind, dann verzögert das die Forschungsarbeiten.
[00:00:19] Klaus Tochtermann:
Also Deutschland muss aus den vielen Projekten einen Nukleus erschaffen, der dazu dient, die deutschen Aktivitäten an Europa anzuschließen. Wir können nicht, wenn wir die NFDI, die Nationale Forschungsdateninfrastruktur, nehmen, 26 Einzelprojekte an eine europäische Initiative andocken. Und da muss es quasi ein Verbindungsstück geben und dieses eine Verbindungsstück das bauen wir, gemeinsam mit neun anderen Partnereinrichtungen in Deutschland.
[00:01:03] Klaus Tochtermann:
Es gibt zwei Ebenen der Resilienz. Das eine ist die technische Resilienz, Ausfallsicherheit, Widerstandsfähigkeit gegenüber Angriffen. Und es gibt die nicht technische Resilienz. Das ist die Resilienz gegenüber Manipulation der abgelegten Daten. Und das haben wir tatsächlich erlebt. Und ich will das auch ganz offen sagen. Das ist in Amerika leider seit zweieinhalb Jahren ein großes Problem, das einfach Datensätze verändert werden, weil sie nicht auf Linie mit der aktuellen Politik in Amerika sind.
[01:47] Doreen Siegfried:
Hallo und herzlich willkommen zu einer neuen Folge von „The Future is Open Science“, dem Podcast der ZBW. Mein Name ist Doreen Siegfried und ich treffe mich hier mit ganz unterschiedlichen Leuten aus dem Wissenschaftsbetrieb, die Ihnen verraten, wie sie in ihrer täglichen Arbeit Open Science voranbringen. Heute reden wir über die zentrale Frage, warum braucht Wissenschaft verlässliche und stabil vernetzte Infrastrukturen und was ist der Vorteil gegenüber agilen und eher flexiblen Systemen? Können wir diese Dichotomie überhaupt aufrechterhalten? Welche Rolle spielen wissenschaftliche Infrastruktureinrichtungen, wie die ZBW, dabei? Werden diese wissenschaftlichen Infrastrukturen gerade mit Blick auf künstliche Intelligenz, Open Science und digitale Souveränität immer wichtiger? Und wenn ja, warum? Und was genau passiert hier gerade im Hause ZBW mit Blick auf resiliente Forschungsdateninfrastrukturen? Um diese vielen Fragen zu diskutieren, habe ich heute zu Gast den Direktor der ZBW. Er ist zugleich Präsident der EOSC Association, also der Europäischen Organisation, die den Aufbau und die Weiterentwicklung der European Open Science Cloud maßgeblich mitgestaltet. Unser Gast ist zudem im wissenschaftlichen Senat der Nationalen Forschungsdateninfrastruktur, auch bekannt unter dem Kürzel NFDI, und er beschäftigt sich seit vielen Jahren mit der Frage, wie digitale Informationsinfrastrukturen Wissenschaft verlässlich unterstützen können. Herzlich willkommen Professor Dr. Klaus Tochtermann.
[00:03:21] Klaus Tochtermann:
Guten Morgen Doreen.
[00:03:22] Doreen Siegfried:
Guten Morgen. Die ZBW erhält jetzt rund 2,2 Millionen Euro für fünf Projekte zum Aufbau von Forschungsdateninfrastrukturen. Und bevor wir jetzt im Detail über NFDI, EOSC und einzelne Projekte sprechen: Warum ist das überhaupt eine Nachricht? Also, was verändert sich dadurch für Wissenschaftler:innen in Deutschland und Europa?
[00:03:48] Klaus Tochtermann:
Zunächst möchte ich die 2,2 Millionen noch ein bisschen erweitern, um das Gesamtprojektvolumen aller Projekte. Das beträgt circa 26 Millionen Euro. Es sind in Summe, glaube ich, 40 verschiedene Partnerorganisationen aus Deutschland und Europa eingebunden. Und das bis Ende 2028. Also die 2,2 Millionen € stehen uns für zweieinhalb bis drei Jahre zur Verfügung. Das ist schon jetzt ein großer Auftrag, der da auf uns zukommt. Worum geht es inhaltlich? Was wird danach anders sein? Zum einen geht es darum, dass wir das Forschungsdatenmanagement in den für die ZBW relevanten Disziplinen, die Wirtschaftswissenschaften, weiterentwickeln. Das ist der erste Teil. Der zweite Teil ist, dass wir die deutschen Infrastrukturinitiativen gerade im Bereich Forschungsdatenmanagement an europäische Entwicklungen andocken. Du hast schon gesagt, die European Open Science Cloud. Das ist quasi die nationalen Initiativen an die europäischen andocken. Und der dritte Teil ist quasi der Weg zurück. Das ist nämlich, aus europäischer Perspektive sicherstellen, dass die deutschen Initiativen andockbar sind. Also es ist quasi von beiden Seiten, von Deutschland nach Europa und von Europa nach Deutschland. Und dann die rein fachlich disziplinären Anstrengungen für die Wirtschaftswissenschaften.
[00:05:17] Doreen Siegfried:
Okay. Angenommen, ich wäre jetzt Wirtschaftswissenschaftlerin und arbeite mit Daten und veröffentliche Papers, nutze verschiedenste KI-Anwendungen. An welcher Stelle begegnet mir eigentlich Informationsinfrastruktur? Möglicherweise, vielleicht, ohne dass ich es überhaupt merke.
[00:05:35] Klaus Tochtermann:
Also, im besten Fall ist es tatsächlich so. Man merkt gar nicht, dass da eine Infrastruktur im Hintergrund ist. Man merkt es erst dann, wenn sie ausfällt. Und da kommen wir ja später noch zum Thema Resilienz. Also im besten Falle ist es tatsächlich so, dass man über die Infrastrukturen, die wir entwickeln, Angebote vermittelt bekommt, die heute nicht existieren. Ich will Beispiele nennen, zwei Stück. Zum ersten ist die Wissenschaft auch in den Wirtschaftswissenschaften nicht mehr alleine auf ihre Daten angewiesen, sondern auch auf die Daten anderer Disziplinen, um Forschungsfragen zu beantworten. Und diese Durchgängigkeit, über Datenrepositorien verschiedener Disziplinen hin recherchieren zu können, ist quasi ein Nutzen, der entsteht, der im Vergleich zu heute eben dann Mehrwerte schafft. Das ist der eine Bereich. Der zweite Bereich bezieht sich darauf, dass wir, wie soll ich sagen, dass wir nicht mehr allein im nationalen Kontext arbeiten, sondern auch die Daten, sagen wir aus den Sozialwissenschaften, in Norwegen, in Frankreich im Zugriff haben. Ohne dafür besondere Anstrengungen unternehmen zu müssen. Wir haben einfach sozusagen einen Account. Und mit dem Account können wir in den europäischen Datenräumen nach den Daten suchen. Durchlässig, ohne zu wissen, wo liegen die eigentlich genau. Ohne mehrere Accounts managen zu müssen.
[00:07:08] Doreen Siegfried:
Okay. Also das heißt, mal angenommen, ich würde jetzt hier in Kiel arbeiten, als Forscherin, müsste ich jetzt nicht mit der Fähre nach Oslo fahren, um mich da einzuloggen in irgendwelche Repositories?
[00:07:19] Klaus Tochtermann:
Ich glaube, das müsste man heute auch nicht. Aber man müsste tatsächlich wissen, in Oslo ist ein Repositorium, für das ich mir Credentials, also einen Account…
[00:07:28] Doreen Siegfried:
Ah, ja.
[00:07:28] Klaus Tochtermann:
… anlegen muss, um mich dort einzuloggen. Und dann hat man am Ende vielleicht von 10, 20 verschiedenen Repositorien Zugangsdaten. Die haben alle irgendwie unterschiedliche Benutzungsschnittstellen. Und das soll eben vereinheitlicht werden über einen Zugang, der sowohl visuell gleich aussieht als auch über die Zugangsdaten, die Art und Weise, wie Ergebnisse zurückgespielt werden, einheitlich ist.
[00:07:53] Doreen Siegfried:
Ja okay. Was würde denn passieren, wenn wir im Wissenschaftsbetrieb solche Infrastrukturen nicht hätten oder sie auch nicht zuverlässig funktionieren würden?
[00:08:03] Klaus Tochtermann:
Na ja, wenn wir sie nicht hätten, die Frage ist einfach zu beantworten. Dann könnte man diese ganze empirische Forschung, die ja jetzt auch in den letzten zehn Jahren enorm an Bedeutung gewonnen hat, nicht mehr in der Form durchführen.
[00:08:17] Doreen Siegfried:
Okay.
[00:08:18] Klaus Tochtermann:
Also, das ist glaube ich recht klar. Und der zweite Teil der Frage war?
[00:08:22] Doreen Siegfried:
Ja, was wäre, wenn es nicht zuverlässig funktionieren würde? Weil darum geht es ja letztlich auch, dass es um Verlässlichkeit geht.
[00:08:29] Klaus Tochtermann:
Genau. Zuverlässig ist auf zwei Ebenen zu betrachten. Einmal, dass die Infrastruktur zuverlässig funktioniert. Das ist in den Infrastrukturen, die wir betreiben, der Fall. Die sind alle redundant und laufen in verschiedenen Rechenzentren. Dadurch ist ein hoher Grad an Zuverlässigkeit gewährleistet. Wenn es nicht geht, wird quasi Forschung ─ und damit auch Innovation ─ einfach verzögert. Wenn also eine Infrastruktur ein halbes Jahr ausfällt und die Daten nicht zugänglich sind, dann verzögert das die Forschungsarbeiten. Zuverlässigkeit bezieht sich aber auch auf die Daten und die Datenqualität. Und die Daten, die eben über solche Infrastrukturen zugänglich gemacht werden, müssen gewisse Qualitätsstandards erfüllen. Und wie diese Qualitätsstandards aussehen, was überhaupt Qualität für die Nutzenden in dem Zusammenhang bedeutet, wird eben gerade in diesen Netzwerken von Forschungsdateninfrastrukturen ausverhandelt.
[00:09:29] Doreen Siegfried:
Okay. Aber man kann sich das ja vielleicht so vorstellen wie in der Deutschen Bahn, wenn das WLAN klappert, wenn die Infrastruktur nicht richtig funktioniert, ist es halt einfach ineffizient.
[00:09:40] Klaus Tochtermann:
Dann wird es langweilig.
[00:09:41] Doreen Siegfried:
Dann wird es langweilig, genau.
[00:09:42]
[beide lachen]
[00:09:42] Klaus Tochtermann:
Genau.
[00:09:42] Doreen Siegfried:
Okay. Wir wollen ja heute sprechen über resiliente Forschungsdateninfrastruktur. Der Begriff klingt vielleicht ein bisschen technisch. Was ist eine Forschungsdateninfrastruktur? Vielleicht könntest du das für unsere Zuhörer und Zuhörerinnen vielleicht an einem konkreten Beispiel aus dem Forschungsalltag erklären.
[00:10:00] Klaus Tochtermann:
Ja, eine Forschungsdateninfrastruktur ist eine technische Umgebung, in der Forschungsdaten einer bestimmten Domäne abgelegt sind. Vielleicht am eingängigsten sind Umweltdaten, also die Luftqualität, oder hier an der Ostsee die Wasserqualität, wird regelmäßig gemessen. Da entstehen Messdaten und diese Daten werden in einem System abgelegt. Und diese Systeme bezeichnet man als Forschungsdateninfrastruktur.
[00:10:29] Doreen Siegfried:
Okay. Wenn wir jetzt davon ausgehen, von der Notwendigkeit, dass tatsächlich Daten und Dienste über Institutionen und Ländergrenzen hinweg miteinander zu verbinden sind. Was muss genau technisch und organisatorisch passieren, damit solche Systeme tatsächlich miteinander arbeiten können? Also, wir hatten ja vorhin das Beispiel mit der Bahn. Also wenn wir tatsächlich so ein Schienennetz legen, metaphorisch gemeint, durch ganz Europa, hat jeder und jede eine Vorstellung, was da genau passiert. Aber was passiert? Wie sieht die Arbeit aus in dem Aufbau von Forschungsdateninfrastrukturen?
[00:11:07] Klaus Tochtermann:
Um beim Beispiel des Schienennetzes zu bleiben. Wenn ich von hier eine Bahnfahrt nach München buche, habe ich auch in den seltensten Fällen, zumindest wenn man in Kiel losfährt, eine direkte Verbindung. Sondern eine Fahrt besteht darin, dass ich mehrere Verbindungen habe, um an den Zielort zu kommen. Und das ist beim Forschungsdatenmanagement natürlich ähnlich. Wenn ich eine Suche zu einem bestimmten Thema, beispielsweise wie entwickelt sich der Preis von Fisch bis zum Jahr 2050 in den Ostsee-Anrainerstaaten. Dann kann ich diese Daten nicht nur aus einem Repositorium bekommen, sondern brauche mehrere. Das heißt, wir haben wie bei der Bahn viele Einzelstrecken, die wir zu bedienen haben. Und die Forschungsdateninfrastrukturen, es ging ja um die Frage, was ist da erforderlich, müssen eben so integriert sein, dass es für die Nutzenden überhaupt gar nicht spürbar ist, dass man, quasi wie bei der Bahn, den Zug wechselt und eben dann eine Strecke mit einem anderen Zug fährt bzw. Daten aus einem anderen Repositorium holt. Dafür sind natürlich technische als auch organisatorische Maßnahmen erforderlich. Ich fange mal mit den technischen an. Sie müssen Standards für den Zugriff auf die Daten erfüllen. Und organisatorische sind zum Beispiel… Wir nennen das Service Level Agreements. Das heißt, bis zu welchem Grad kann denn sichergestellt werden, dass ein Dienst zuverlässig läuft? Grad der Zuverlässigkeit. Beispielsweise sind es sieben Tage, 24 Stunden mit einer 90-prozentigen Ausfallwahrscheinlichkeit oder mit einer 95-prozentigen Ausfallwahrscheinlichkeit. Und das wird in gegenseitigen Vereinbarungen festgeschrieben.
[00:12:58] Doreen Siegfried:
Ja, okay. Nun gibt es ja in Deutschland und Europa viele Universitäten, Rechenzentren und Forschungsorganisationen. Warum braucht das Wissenschaftssystem jetzt Einrichtungen wie die ZBW?
[00:13:11] Klaus Tochtermann:
Das liegt an dem Auftrag, dauerhaft solche Infrastrukturen für die Wissenschaft bereitzustellen. Der Schwerpunkt von Universitäten ist Forschung und Lehre. Universitäten sind in der Regel nicht aufgestellt, um dauerhaft für die Nation, für Deutschland, eine Infrastruktur bereitzustellen. Es liegt auch daran, dass die Universitäten eben im Hoheitsgebiet der Länder liegen und länderfinanziert sind. Einrichtungen wie die ZBW, und da gibt es ja verschiedene andere auch, haben einen hohen Anteil an Bundesförderung. Und dank der Bundesförderung haben wir eben auch den Auftrag, für Deutschland dauerhaft Infrastrukturen zu betreiben. Und deswegen macht es schon Sinn, dass solche Forschungsdateninfrastrukturen, die wirklich für eine ganze Wissenschaftscommunity in Deutschland zur Verfügung gestellt werden, von Einrichtungen der ZBW betrieben werden. Und dafür braucht man sie.
[00:14:07] Doreen Siegfried:
Ja okay. Welche Kompetenzen bringt denn die ZBW ein, die einzelne Universitäten oder ein einzelnes Forschungsprojekt typischerweise nicht dauerhaft vorhalten kann?
[00:14:18] Klaus Tochtermann:
Also die Universitäten bringen vor allem Innovation in solche Vorhaben rein. Das ist ein großer Wert, weil dort eben auch wirklich viel Forschung gemacht wird. Wir machen das auch. Aber die Kernkompetenz, die wir eben haben, ist, dass wir wissen, wie müssen solche Systeme gebaut werden, dass sie robust, dauerhaft, ausfallsicher laufen. Also der Betrieb solcher Systeme, das ist eine Kompetenz, die wir haben. Und deswegen ist auch diese Zusammenarbeit mit Universitäten in unseren Projekten sehr fruchtbar. Wie gesagt, von den Universitäten Innovation, von uns Kompetenz, wie man solche Infrastrukturen ausfallsicher baut und dauerhaft betreibt.
[00:15:08] Doreen Siegfried:
Du hast ja schon gesagt, es gibt eine Zusammenarbeit mit den Unis, von da kommt die Innovation. Hier gibt es auch ganz viele Forschungstätigkeiten, wo ich jetzt auch mal das Label Innovation ran packen würde. Die ZBW hat langjährige Erfahrung im Betrieb von Infrastrukturen und bezeichnet sich ja auch als eine Art soziotechnologische Schaltstelle im Ökosystem der Forschungsdateninfrastrukturen. Was heißt das ganz praktisch, ein solches Scharnier zu sein?
[00:15:37] Klaus Tochtermann:
Wir können solche Infrastrukturen nur dann erfolgreich etablieren, wenn wir den Zugang zu einer Fachgemeinschaft haben, also beispielsweise der Fachgemeinschaft der Wirtschaftswissenschaften. Und wo ist diese Fachgemeinschaft? Die Fachgemeinschaft ist verteilt an den Universitäten. Und das ist der soziale Aspekt. Das heißt, ohne die Netzwerke in die Wirtschaftswissenschaften hinein, zu den später Nutzenden, können wir zwar alles Mögliche technisch bauen, aber ob es von den Nutzenden tatsächlich eingesetzt wird, ist fraglich. Und der technische Teil dieser soziotechnologischen Infrastrukturen ist klar, das ist einfach die Technologieentwicklung.
[00:16:16] Doreen Siegfried:
Okay. Jetzt erhält, das hatte ich ja vorhin schon gesagt, die ZBW Mittel für fünf Vorhaben, ganz unterschiedliche Vorhaben sind das, zum Aufbau resilienter Forschungsdateninfrastrukturen in Deutschland und Europa. Ich erspare mir jetzt die ganzen Abkürzungen. Die packen wir in die Shownotes. Da können unsere Zuhörer und Zuhörerinnen noch mal nachlesen. Was verbindet jetzt diese fünf Vorhaben? Gibt es so was wie eine gemeinsame strategische Idee dahinter? Vielleicht kannst du mal kurz erläutern, worum geht es da eigentlich?
[00:16:48] Klaus Tochtermann:
Also ich sagte es eingangs schon, dass es drei Aspekte sind. Zum einen wollen wir das Forschungsdatenmanagement für die Wirtschaftswissenschaften in Deutschland auf ein neues Niveau heben. Was heißt das konkret? Während in der Vergangenheit Publikationen und Forschungsdaten irgendwie getrennt in Infrastrukturen, einmal in den Bibliotheken, einmal in Forschungsdatenzentren lagen, gibt es eben den Trend dorthin, die Publikationen, die Forschungsdaten und dann auch Methoden der künstlichen Intelligenz als ein digitales Objekt zu betrachten. Warum ist das wichtig? Damit die Forschungsgemeinschaft sieht, okay, in der Publikation wurde dieses Datenset mit folgenden KI-Methoden analysiert – dieses Dreieck. Das hat eben eine große Bedeutung bekommen in den vergangenen Jahren. Und sowas muss gebaut werden. Da sind wir dabei. Also das ist ein konkretes Beispiel für die nationalen Anstrengungen. Die Anstrengungen, damit Deutschland an Europa angedockt werden kann, sind folgende: Also Deutschland muss aus den vielen Projekten einen Nukleus erschaffen, der dazu dient, die deutschen Aktivitäten an Europa anzuschließen. Wir können nicht, wenn wir die NFDI, die Nationale Forschungsdateninfrastruktur nehmen, 26 Einzelprojekte an eine europäische Initiative andocken. Und da muss es quasi ein Verbindungsstück geben. Und dieses eine Verbindungsstück das bauen wir, gemeinsam mit neun anderen Partnereinrichtungen in Deutschland, damit die Angebote, die es in Deutschland gibt, aus Europa heraus sichtbar werden. Das ist der zweite Teil. Der dritte Teil ist, wir sind dann in Europa mit unseren Angeboten. Dann sollen unsere Angebote auch mit den Angeboten aus Finnland, aus Niederlanden, aus Frankreich zusammenarbeiten. Und das ist der dritte Teil der Projekte, das wir speziell für die Softwareumgebungen, mit denen wir unsere Forschungsdateninfrastrukturen bauen, Lösungen schaffen, dass die anschlussfähig sind an ähnliche Infrastrukturumgebungen in Europa.
[00:19:11] Doreen Siegfried:
Ja, okay. Das heißt, es geht im Großen und Ganzen darum, diese Anschlussfähigkeit herzustellen von den unterschiedlichen Netzwerken.
[00:19:21] Klaus Tochtermann:
Genau.
[00:19:22] Doreen Siegfried:
Im Zusammenhang mit Forschungsinfrastrukturen oder auch Forschungsdateninfrastrukturen fällt in vielen Diskussionen seit geraumer Zeit zunehmend der Begriff der Resilienz. Wir kennen das aus anderen Kontexten. Aber was bedeutet genau eine resiliente Forschungsdateninfrastruktur? Wogegen muss sie resilient sein? Also, geht es um technische Ausfälle? Geht es um politische Veränderungen? Geht es um Abhängigkeiten von einzelnen Anbietern, Finanzierung? Ja, also, vielleicht kannst du es kurz erläutern.
[00:19:55] Klaus Tochtermann:
Es gibt zwei Ebenen der Resilienz. Das eine ist die technische Resilienz: Ausfallsicherheit, Widerstandsfähigkeit gegenüber Angriffen. Und es gibt die nicht technische Resilienz. Das ist die Resilienz gegenüber Manipulation der abgelegten Daten. Und das haben wir tatsächlich erlebt. Und ich will das auch ganz offen sagen. Das ist in Amerika leider seit zweieinhalb Jahren ein großes Problem, dass einfach Datensätze verändert werden, weil sie nicht auf Linie mit der aktuellen Politik in Amerika sind. Konkretes Beispiel in den Sozialwissenschaften: Bei den Umfragen wurden systematisch die Geschlechter männlich, weiblich, divers entfernt. Also diese Daten sind unwiderruflich einfach weg. Und da muss man quasi widerstandsfähig gegen sein. So was darf und soll nicht passieren.
[00:20:59] Doreen Siegfried:
Ja, okay. Das ist total verständlich. Du hattest vorher schon vorhin in dieser Erklärung des Dreiklangs schon KI erwähnt. Also künstliche Intelligenz ist im wissenschaftlichen Alltag schon längst kein Werkzeug mehr allein zum Formulieren von Texten. Forschende nutzen KI inzwischen auch für Literaturrecherche und Zusammenfassungen, beim Programmieren, für Datenanalyse und für Modellierungen usw. usw. Also KI beginnt damit, sich durch nahezu den gesamten Forschungsprozess zu ziehen. Warum braucht gerade KI-gestützte Wissenschaft gute Forschungsdateninfrastrukturen?
[00:21:39] Klaus Tochtermann:
Künstliche Intelligenz kann nicht ohne Daten funktionieren. Und in allen Strategiepapieren zur künstlichen Intelligenz, auf europäischer Ebene ist es Science4AI, ist klar festgeschrieben, dass Europa eine Forschungsdateninfrastruktur braucht, aus der heraus die KI entwickelt werden kann. In Deutschland ist es ähnlich. Also auch in der Nationalen Forschungsdateninfrastruktur gibt es Empfehlungen, dass diese als Datengrundlage für KI dienen soll. Warum? Weil diese Daten, die wir national oder europäisch haben, transparent sind bezüglich Herkunft, Erhebungsmethode und ähnliches. Und dadurch können wir auch transparente KI-Methoden entwickeln und anwenden. Anders als bei vielen KI-Systemen, die frei im Internet verfügbar sind, wo die Datengrundlage für alle eine Blackbox ist. Wir wissen nicht, welche Daten dort verwendet werden. Wir wissen nicht ob, wir hatten eben das Thema Manipulation, die Daten irgendwie manipuliert wurden, ob da eine Bias, also eine quasi Richtungsorientierung, drin ist, die von den Anbietern hineingebracht wurde. Das wollen wir nicht. Wir wollen ermöglichen, dass KI transparent und auch nachvollziehbar ist und deswegen unsere Forschungsdatenangebote aus Deutschland und Europa als Grundlage für die europäische KI-Entwicklung verwenden.
[00:23:13] Doreen Siegfried:
Okay. Also das heißt, man möchte einfach wissen, was ist drin im Kuchen an Zutaten, …
[00:23:19] Klaus Tochtermann:
Genau.
[00:23:20] Doreen Siegfried:
… bevor ich den sozusagen teile.
[00:23:21] Klaus Tochtermann:
Ja, genau.
[00:23:21] Doreen Siegfried:
Okay. Ein weiterer großer Begriff ist das Thema digitale Souveränität. Was bedeutet digitale Souveränität im Wissenschaftssystem?
[00:23:34] Klaus Tochtermann:
Wir hängen im Wissenschaftssystem und hier nehme ich nicht das globale, sondern Europa, an vielen Stellen von nicht europäischen Diensteanbietern ab. Sei es ein Clouddienst, also wo riesige Rechenkapazitäten oder Speicherkapazitäten zur Verfügung sind. Und solche Abhängigkeiten sind insbesondere dann gefährlich, wenn die Anbieter sich politisch beeinflussen lassen und in Abhängigkeit der politischen Einflussnahme Angebote verändern, einstellen oder die Inhalte, die dort sind, für sich verwenden. Das wollen wir nicht in Europa, sondern wir wollen, und das bedeutet Souveränität, wir wollen hier unabhängig sein und entsprechend europäischer Regeln, aber auch europäischer Werte, Infrastrukturen betreiben. Ein europäischer Wert ist beispielsweise, wir wollen keine Daten manipulieren.
[00:24:31] Doreen Siegfried:
Ja, okay. Ich würde hier noch mal ein bisschen einsteigen wollen. Also wann wird Abhängigkeit von kommerziellen Plattformen oder einzelnen Technologieanbietern für Wissenschaft problematisch? Da hattest Du gerade schon das Thema der Manipulation genannt. Und bis wann ist es noch okay und vielleicht einfach nur gute Public Private Collaboration? Also, wo ist da so ein Kipppunkt?
[00:24:59] Klaus Tochtermann:
Also wichtig ist für uns und das bieten ja auch tatsächlich viele Anbieter aus außerhalb Europas an, dass sie auch beispielsweise Serverfarmen in Europa haben. Und wir wissen, dass die Daten in Europa bleiben. Und ganz wichtig ist, dass die Daten nicht für beispielsweise Trainingszwecke von künstlicher Intelligenz dieser Anbieter verwendet werden. Das sind so ein paar rote Linien, die nicht überschritten werden können. Da gibt es noch mehr. Ich nehme das Thema Datenschutz, wo es eben auch ganz unterschiedliche Auffassungen gibt. Und wenn diese Rahmenbedingungen so sind, dass man hier entsprechend der europäischen Werte, also nicht ohne Zustimmung, die Daten in ein KI-Training einbringen oder die Eigentumsrechte nicht verletzen, sondern die Daten gehören nach wie vor denjenigen, die sie bereitgestellt haben, einhält, dann kann man natürlich auch diese nicht europäischen Infrastrukturanbieter verwenden. Nichtsdestotrotz fühlen wir uns wohler, wenn wir solche Infrastrukturen in Europa und für Europa haben. Und da gibt es ja jetzt auch Anstrengungen. Das Stichwort hier sind die KI-Gigafactories. Also das sind die ganz riesigen Rechenzentren, die mithilfe von europäischen Mitteln jetzt in Europa aufgebaut werden.
[00:26:23] Doreen Siegfried:
Ah ja. Okay. Forschungsprojekte laufen häufig drei oder fünf Jahre. Manchmal sogar noch kürzer. Also Forschungsdaten sollen aber, die in solchen Forschungsprojekten entstehen, sollen ja Jahrzehnte erhalten werden. Also am liebsten sogar für Jahrhunderte und nachnutzbar bleiben. Wer übernimmt die Verantwortung, wenn ein Forschungsprojekt schon längst beendet ist? Für diese Forschungsdaten?
[00:26:54] Klaus Tochtermann:
Da sind wir beim Thema digitale Langzeitarchivierung. Das sind am Ende des Tages Einrichtungen wie die ZBW oder spezielle Einrichtungen, die sich dem Archivieren von Daten, Software widmen und das als primären Auftrag haben. Aber es ist tatsächlich so, dass bei uns, jetzt aus Sicht der ZBW, nicht nur der ausfallsichere, dauerhafte Betrieb der Infrastruktur eine Rolle spielt, sondern auch die Gewährleistung der Datenverfügbarkeit über viele Jahre hinweg. Die DFG sieht vor zehn Jahre. Man kann im Moment noch nicht absehen, ob 20 Jahre, 50 Jahre oder bis in alle Ewigkeit die richtige Größenordnung ist. Wir jedenfalls legen alle Daten, die in Infrastrukturen der ZBW vorkommen, in unser digitales Langzeitarchiv.
[00:27:49] Doreen Siegfried:
Okay. Also wer darüber mehr erfahren will, da verweise ich auch noch mal in unsere Shownotes. Wenn wir jetzt noch mal ganz praktisch auf den Forschungsalltag schauen. Ich rücke mal wieder in die Rolle einer Wirtschaftswissenschaftlerin. Was sollte eine Forscherin oder ein Forscher durch diese Infrastruktur vielleicht in einigen Jahren besser kennen als heute? Wir hatten am Anfang gesagt, „Okay, der Zugriff auf unterschiedliche Daten.“ Aber gibt es noch weitere Visionen, was die Forschung in wenigen Jahren eventuell anders machen kann? Oder besser?
[00:28:30] Klaus Tochtermann:
Ja, also wir wollen ja nicht nur die Daten ablegen, sondern auch die Daten in einem Zusammenhang. Mit dem Zusammenhang einer Publikation, im Zusammenhang von Analysemethoden. Und dadurch ist es eben in Zukunft auch möglich, zu analysieren, „Aha, wurde auf einem bestimmten Datensatz schon mal eine Analyse mit einer bestimmten Methode durchgeführt und zu welchem Ergebnis hat die geführt?“ Das kann man heute nur ganz, ganz schwierig ermitteln, weil diese ganzen Komponenten (Daten, Publikationen und Analysemethoden) an ganz verschiedenen Orten liegen, wenn sie überhaupt irgendwo liegen. Das Problem ist vor allen Dingen, dass die Analysemethoden halt nirgendwo abgelegt sind, also die Software nicht. Und das wollen wir eben bündeln. Und dadurch kann natürlich auch Redundanz in der Wissenschaft vermieden werden. Dadurch kann man auf einem viel höheren Niveau mit seiner Forschung einsteigen, weil man eben weiß, diese Analyse ist mit den Daten schon durchgeführt worden, aber vielleicht das folgende Delta noch nicht und darauf kann man dann aufsetzen.
[00:29:31] Doreen Siegfried:
Okay. Also ich kriege … Ich versuche noch mal irgendwie Metaphern zu finden für Leute, die nicht aus dem Wissenschaftskontext oder nicht so tief aus dem Wissenschaftskontext kommen. Das heißt, ich kriege nicht nur den Baumwollstoff auf den Tisch gelegt, sondern auch noch das Schnittmuster und die dazugehörige Nähmaschine, so dass ich tatsächlich sagen kann, okay. Und noch ein Foto davon. So wurde es gemacht.
[00:29:54] Klaus Tochtermann:
Ja.
[00:29:54] Doreen Siegfried:
Und das ist der Apparat dazu, wie es im Jahre 2026 hergestellt wurde.
[00:30:00] Klaus Tochtermann:
Ja, oder wir können auch in die Bäckerei gehen. Ich kriege eben den Kuchenboden.
[00:30:05] Doreen Siegfried:
Ja.
[00:30:06] Klaus Tochtermann:
Kann ich fertig kaufen. Ich kann die Schichten oben drauf, mir die Zutaten kaufen. Und vielleicht ganz auf der obersten Schicht. Da kommt irgendwas, was ich mir selbst ausdenke, sei es ein bestimmtes Obst, das ich dafür besonders hübsch drapiere. Aber um den ganzen Unterbau muss ich mich eben nicht kümmern oder nur insoweit kümmern, dass ich vorgefertigte Dokumente, nicht Dokumente, sondern vorgefertigte Komponenten verwenden kann, um den Kuchen sozusagen aufzubauen.
[00:30:36] Doreen Siegfried:
Ja, oder auch eben genau zu replizieren. Okay. Wagen wir doch mal einen Blick in die Zukunft. Wie sollte das Europäische Forschungsdatenökosystem in fünf bis zehn Jahren idealerweise funktionieren?
[00:30:51] Klaus Tochtermann:
Idealerweise wäre es so, dass wir grenzüberschreitende Nutzung ermöglichen, ohne dass die Forschenden die ganzen Schwierigkeiten, die damit zusammenhängen, irgendwie bewältigen müssen. Das muss im Hintergrund geschehen. Und welches sind die Schwierigkeiten? Also viele Angebote heutzutage werden mit nationalen Mitteln verwendet und unter Verwendung von nationalen Mitteln aufgebaut. Und ich nehme Frankreich. Die haben eine Infrastruktur. Jetzt kommt jemand aus den Niederlanden, will die nutzen. Dann ist es heute leider so, dass bei dieser Cross-Country-Nutzung Frankreich sagt, „Wir dürfen aber nicht nationale Mittel verwenden, dass Forschende in den Niederlanden eine bessere Analyseumgebung haben.“ Das heißt, diese ganze Durchlässigkeit von nationaler Forschungsfinanzierung über die Grenzen hinweg. Das muss geregelt sein. Das ist heute tatsächlich noch ein großes Problem. Das soll in den Hintergrund gelegt werden.
[00:32:03] Doreen Siegfried:
Also eine Art Schengen.
[00:32:04] Klaus Tochtermann:
Eine Art Schengen für die …
[00:32:06] Doreen Siegfried:
Ja.
[00:32:07] Klaus Tochtermann:
Oder eine Art Währungsunion für die nationalen Infrastrukturen, die ja alle Geld kosten. Das kostet einfach alles Geld. Sei es für die Speicherung, sei es für Rechenkapazitäten. Und da haben wir im Moment, so europäisch wir auch sein wollen, tatsächlich noch nationale Grenzen, die das nicht zulassen. Das wäre also ganz, ganz wichtig. Ein zweites Beispiel, jenseits der Finanzen, ist die Auslegung von Datenschutz. Wir haben zwar ein europäisches Datenschutzrecht, die Auslegung dieses Datenrechts, wir sehen es ja schon in Deutschland, wo es von Bundesland zu Bundesland verschieden ist, ist natürlich auf europäischer Ebene noch mal unterschiedlicher. Und auch das ist etwas, womit sich die Forschenden eigentlich nicht befassen wollen. Sie wollen halt die Forschung machen und nicht … Und das heißt, wir sollen auch einen rechtssicheren Rahmen für sie geben, ohne dass sie sich drum kümmern müssen, ja bin ich jetzt in einer rechtlichen Grauzone, oder nicht? Und da gibt es eine Menge solcher Beispiele, damit das wirklich für die Forschenden zukünftig vom Gefühl so ist, als würden sie in ihre lokale Bibliothek gehen und sich Literatur ausleihen. Da machen sie sich auch keine Gedanken darüber, wer hat jetzt das Buch bezahlt und verletze ich vielleicht irgendwie ein Datenschutzgesetz?
[00:33:20] Doreen Siegfried:
Ja, okay. Welche Rolle sollte denn Deutschland innerhalb eines europäischen Forschungsdatenraums spielen?
[00:33:27] Klaus Tochtermann:
Also Deutschland kann hier eine ganz zentrale Rolle spielen, weil Deutschland tatsächlich die einzige Nation ist, die in so erheblichem Maße Forschungsdateninfrastrukturen fördert. In der NFDI waren in den ersten zehn Jahren, die enden Ende 2028, 1 Milliarde € investiert worden. Und gerade im Juli diesen Jahres ist die Bund-Länder-Vereinbarung für die nächsten zehn Jahre, das heißt ab 1. Januar 29 dann bis Ende 38, abgeschlossen worden. In dem Zusammenhang ist eine weitere Milliarde Euro zur Verfügung gestellt worden. Ein solches Programm zum Aufbau von Forschungsdateninfrastruktur sucht in Europa seinesgleichen. Die einzigen, die mithalten können, ist dann die Europäische Forschungsdateninfrastruktur, die EOSC. Wo in den vergangenen acht Jahren, meine ich, 2 Milliarden € investiert wurden. Aber da ist Deutschland absolut Spitzenreiter. Und vor dem Hintergrund haben wir natürlich auch Kompetenzen, Erfahrungen und letztendlich auch als eine der größten Einzahlnationen in das europäische Budget ein erhebliches Mitspracherecht, wie sich solche Infrastrukturen zukünftig gestalten sollen.
[00:34:46] Doreen Siegfried:
Ja, okay. Abschließende Frage. Letzte Frage. Was wäre für Dich nicht nur als Direktor der ZBW, sondern auch als EOSC-Präsident und als europäischer Akteur in diesem ganzen Forschungsdatenraum … Was wäre für Dich persönlich ein Zeichen dafür, dass die Arbeit an NFDI, EOSC und den beteiligten Infrastrukturen wirklich erfolgreich war?
[00:35:14] Klaus Tochtermann:
Wenn die ganzen Angebote, die wir jetzt entwickeln, so selbstverständlich angenommen und genutzt werden, wie es bei Bibliotheken bereits seit vielen, vielen Jahrzehnten der Fall ist. Weil letztendlich bauen wir die Infrastrukturen ja nicht, weil wir technologisch da Spaß haben, sondern weil wir für eine Wissenschaftscommunity Angebote schaffen wollen. Und wenn diese Angebote so selbstverständlich auch in dem Umfang genutzt werden wie wissenschaftliche Bibliotheken, dann sind wir erfolgreich.
[00:35:45] Doreen Siegfried:
Super! Ich bedanke mich ganz herzlich. Vielen Dank auch an Sie an den Kopfhörern. Ich hatte es vorhin schon angekündigt, wer jetzt genau wissen will, welche fünf Projekte sind das oder was gibt es noch Neues zum Thema EOSC usw. findet Informationen noch mal zum Weiterlesen und Weiterhören in den Shownotes. Ich hoffe, es hat Ihnen gefallen. Lassen Sie uns gerne Lob oder Kritik da, sei es via E-Mail, Mastodon, YouTube oder LinkedIn. Wir freuen uns natürlich auch, wenn Sie uns abonnieren, und ich freue mich aufs nächste Mal.
