Skip to main content
Meldung

NFDIxCS Symposium on Research Data Management for and with Computer Science

On September 26, 2024, the first NFDIxCS Symposium took place at RheinMain University of Applied Sciences in Wiesbaden. This event brought together experts in research data management (RDM) and academics to explore innovative approaches and the latest developments in the field. Held as part of the 2024 INFORMATIK FESTIVAL, the annual meeting of the Gesellschaft für Informatik (GI), it provided a full day for discussion and collaboration.

[GERMAN TRANSLATION AVAILABLE BELOW]


Prof. Dr. Ulrike Lucke (University of Potsdam, Deputy Speaker NFDIxCS) and Prof. Dr. Michael Goedicke (University of Duisburg-Essen, Speaker NFDIxCS) opened the symposium with an introduction to the goals and activities of the consortium, along with an overview of the three program areas of the day: (1) Outreach & Community Building, (2) Metadata & Research Software, and (3) Knowledge Graphs & RDM Containers.  

Two keynote presentations set the stage for workshops aligned with these themes:

  • Dr. Oliver Karras (TIB – Leibniz Information Centre for Science and Technology / NFDI4Ing) discussed practical applications of the Open Research Knowledge Graph (ORKG) and ORKG Ask, demonstrating how these can be utilized both within NFDI and beyond.
  • Cord Wiljes (NFDI e.V. Headquarters) presented on the integration of FDM Helpdesks within the NFDI network, highlighting current information and support services within and beyond NFDI.

Throughout the day, participants engaged in three dynamic workshops: Workshop I focused on "Outreach and Community Building," Workshop II explored "Metadata and Research Software," and Workshop III delved into "Knowledge Graphs and RDM Containers."

These sessions provided valuable insights and fostered collaboration within the research community. The insights shared and the ideas generated in these discussions lay an important foundation for future work within NFDIxCS and in collaboration with other RDM initiatives.

In the future, NFDIxCS plans to organize additional symposia and foster more intensive exchanges to advance the use of knowledge graphs and large language models in science. We thank all participants for their contributions and look forward to the next NFDIxCS Symposium in spring 2025. 

Until soon!

 

Workshop Highlights & Collaborations

In the workshops, scientists and experts from other consortia, such as Text+ and NFD4DataScience, were also invited to collaboratively discuss challenges, foster connections, and deepen mutual understanding of issues and advancements.

In the first workshop, Outreach & Community Building, Alexandra Resch (Gesellschaft für Informatik e.V.) kicked off the program by introducing the NFDIxCS Coffeetable Book, a collection featuring insights from international contributors on their extensive experience in research data and software management across various fields. Next, Christine Hennig (Fraunhofer FOKUS / NFDI4DataScience) elaborated on shared initiatives between NFDI4DS and other NFDI consortia, particularly regarding to NFDIxCS. After that, Cord Wiljes (NFDI) discussed the importance of networking between NFDI and other RDM organizations to foster a cohesive RDM practice. Each topic was followed by lively discussions, summarized at the end of this overview section.

The second workshop, Metadata & Research Software, concentrated on the topics and challenges involved in managing and utilizing metadata within the context of NFDIxCS. Jennifer Ecker from the Leibniz Institute for the German Language and Text+ demonstrated how metadata can be enriched using natural language processing (NLP) techniques. Dr. Eike Spielberg from the University of Duisburg-Essen introduced the “SDG Classification of Publications,” showcasing a transition from single to mass classification methods. Additionally, Cord Wiljes contributed to the discussion by sparking a conversation on establishing standards for research data management (FDM) metadata.

In the third workshop, Knowledge Graphs & RDM Containers, Dr. Oliver Karras, Angelika Kaplan (Karlsruhe Institute of Technology), and Maximilian Harms (University of Bayreuth) presented methods for using knowledge graphs and large language models (LLMs) to improve research data accessibility. Each presentation included dedicated discussion sessions, fostering deeper exploration of these innovative technologies.

All presentations are available on Nextcloud:


Discussion Summaries

1. Workshop “Outreach & Community Building”: Developing a Shared Vision

Under the motto "Sharpening the Shared Vision: Considering the Youngest in RDM from the Start," the initiatives focused on further networking their activities to establish improved research data management (RDM) and practices. A significant challenge, yet also a major advantage, is the large number of involved partners and stakeholders, as well as the overlaps in different areas of work.

A comparative analysis of NFDI4DS and NFDIxCS showed that while the two consortia share many similarities, they have different focal points. Both, for example, plan community activities such as organizing and participating in RDM Summer and Winter Schools. Additionally, they developed personas as part of requirements engineering. A closer look, however, reveals that each consortium tackles distinct challenges with unique solutions: while NFDI4DS specifically targets data science application areas, NFDIxCS focuses on computer science and software domains. 

In discussions, it became clear that a cultural shift in RDM relies on two pillars: first, recognizing and addressing domain-specific mindsets, as reaching specific target audiences effectively requires understanding their unique vocabulary and needs. Second, RDM initiatives should continuously and collaboratively pursue their shared goals. RDM should be more systematically integrated, for example, with workshops in doctoral colloquia. Additionally, RDM engagement urgently needs greater recognition.

The collaborative approach can draw on established structures, including more intensive use of regional and international networks and connections to new communities:

  • The NFDI consortia and NFDI e.V. play a central role in fostering connections. For instance, NFDI e.V. is a member of the European Open Science Cloud Association (EOSC), which provides opportunities for international collaboration.
  • The Research Data Alliance (RDA) and RDA Germany, both associations with national and international networking structures, offer additional connection points for interested parties. Another way to initiate collaboration is by contributing articles to platforms such as forschungsdaten.info and forschungsdaten.org.
  • A key event for research data management is Love Data Week, an open international event where participation is highly encouraged. Further information is available on forschungsdaten.org.
  • Research data management is also coordinated at the state level. State-level RDM initiatives organize RDM projects and typically offer training and information. An example is HeFDI (Hessian Research Data Infrastructures), which regularly hosts virtual events like the HeFDI Code School. Strengthening the network of state initiatives with other national and international RDM initiatives is a stated goal.
  • Beyond academia, civil society and industry are exciting target groups. Closer connections with civic coding initiatives and commercial publishers would be desirable. Attending events like Berlin Science Week or similar open events can help establish new partnerships.

NFDIxCS Symposium: PostIts zum Workshop Community Building

2. Workshop “Metadata & Research Software”: Towards Establishing Metadata Standards

Establishing metadata standards faces several challenges. First, successful standardization requires clear processes and committed communities to implement them. Second, since enforcing new standards for initiatives is often impractical, new practices tend to emerge based on recommendations or best practices. Third, there exists a tension between the need to maintain meaningful disciplinary standards and the desire to create overarching standards. Metadata standards must be conceptualized and understood on an international level. When new standards are developed for Germany, they can be integrated into German academia through established processes.

Common data standards include the widely used Dublin Core, the DCAT standard from W3C, and established standards from schema.org for structured data on the web. While DataCite is a recognized standard, it is underutilized. For software, there is the specific SPDX standard. Researchers in text+ are working on linked data, which connects datasets to others, such as Wikidata.

Automated processes have sparked intense discussions regarding metadata practices. Participants discussed how the use of knowledge graphs could enable the automatic generation of metadata that expresses the relationship of an artifact to others. It would also be interesting to enrich non-textual data with semantic metadata.

Further, a key question arouse about how much human involvement is still needed to ensure high accuracy. Current automated systems exhibit a high tolerance for error, necessitating oversight by authors. However, manual quality assurance for such metadata is resource-intensive. It has been suggested to pool resources to hire specialized data curators.

Next, the use of artificial intelligence (AI) and metadata was discussed since AI plays a significant role in metadata generation. One symposium guest noted, "We are falling behind the technology." There is a desire for automated or semi-automated systems for metadata generation, for example, as an add-on for NFDIxCS. To enhance metadata quality, various generation approaches should be developed collaboratively. A computer could generate initial metadata, which would then be supplemented and verified by authors and curators. For effective metadata quality assurance, so-called meta-meta-data could be introduced to document how the metadata was created and controlled. Quality criteria for metadata, to be recorded in the meta-meta-data, should be developed collaboratively. These could include information on data annotation and curation.

Finally, an exciting opportunity for cross-consortium collaboration is offered by the NFDI-section "Metadata." This group addresses central questions regarding metadata standards and applications. The next section meeting is scheduled for December, and further information is available at nfdi.de/section-metadata/. The topic of research software and its associated metadata also occupies a special focus within the NFDI base service nfdi.software. Here, quality assurance is also crucial to make the handling of metadata more efficient and sustainable.

NFDIxCS Symposium: PostIts zum Workshop Metadaten & Forschungssoftware

 

3. Workshop “Knowledge Graphs & RDM Containers”: Improving Science through Knowledge Graphs

This workshop focused on a long-term vision to make science more accessible and enriched through the use of knowledge graphs. A central focus was on the ORKG (Open Research Knowledge Graph) and the ORKG Ask platform, designed to manage publications, data, and software. These systems use artificial intelligence: ORKG is "AI-augmented," while ORKG Ask is fully "AI-driven." The goal of this AI support is to organize and present knowledge more efficiently than conventional PDF papers allow today. Knowledge graphs act as a bridge between various scientific artifacts, creating a more comprehensive form of knowledge representation. For these graphs to be fully effective, especially for young researchers, a shared knowledge base is essential.

A major challenge is advancing the automation of data import into knowledge graphs. The aim is to recognize classifications accurately and generate relevant suggestions. A significant issue raised was that while titles and abstracts are often accessible, there are frequent gaps in available data. Full texts are rarely included, and using abstracts can be legally restricted due to copyright issues. Some agreements have been made to allow abstract use, but one participant pointed out that the most crucial information is often not found in the abstract alone. Demonstrations of knowledge graphs showed similar limitations: essential metadata are often not reliably extracted. Additionally, the question remains of how to make non-machine-readable publications usable within knowledge graphs.

The workshop presented three different schemas for inputting data into knowledge graphs, with the teams aiming to compare methods, learn from each other, and collaborate. Especially in the area of abstract extraction, a collaboration is being sought between TIB and the University of Bayreuth to improve AI models through larger test datasets. Regarding the optimization and application of AI, a symposium guest noted in conclusion that it may not be long before it becomes possible to generate a complete paper from the results and annotations of a knowledge graph.

The ontology of a knowledge graph was another highly debated topic, particularly the challenges of the so-called multilabeling and questions of maintenance. Different knowledge graphs, such as Wiki Data and ORKG, use distinct ontologies. This raised the question of how to manage multiple ontologies across different knowledge graphs. A suggestion was made to use simpler ontologies to avoid interoperability issues. In one proposed model, a paper is described by object, property, and method. Additionally, better integration of ontology, artifact evaluation, and the review process is recommended.

But are ontologies necessary for knowledge graphs when large language models (LLMs) exist? This question was also discussed, with the preliminary answer being yes. Currently, LLMs can only complement research graphs. Research data often isn’t in natural language and may not be accompanied by papers, making it challenging for LLMs to process. LLMs also seem to lack reliability for scientific applications without highly specific prompt engineering. With suitable ontologies, however, the reliability of LLMs could be improved. An employee of the Karlsruhe Institute of Technology (KIT) advocated for a hybrid approach that combines both knowledge graphs and LLMs: “Relying solely on one or the other would be a mistake. The balance needs ongoing evaluation.”

Semantic modeling of research artifacts within knowledge graphs remains a key issue. Members of the NFDIxCS consortium, who work on metadata standards, are exploring how to find a common denominator across different computer science subdisciplines. One participant suggested widening the research scope to foster cross-disciplinary thinking, as knowledge graphs hold significance across various domains, not just in computer science.

A particular challenge lies in the inconsistent terminology across disciplines. Terms like “theory” and “model” have distinct meanings within each field. A systematic comparison across as many disciplines as possible and deeper insights from the sociology of science would be necessary to approach a universal model.

 

 

NFDIxCS Symposium: PostIts zum Workshop Knowledge Graphs & RDM - Container

[DEUTSCHE VERSION]


Am 26. September 2024 fand das erste NFDIxCS Fachsymposium an der Hochschule RheinMain in Wiesbaden statt. Einen ganzen Tag kamen Akteur*innen aus Wissenschaft und Forschungsdatenmanagement zusammen, um innovative Ansätze und die neuesten Entwicklungen im Forschungsdatenmanagement (FDM) zu diskutieren. Das Symposium war Teil des INFORMATIK FESTIVALS 2024, der Jahrestagung der Gesellschaft für Informatik e.V.

Prof. Dr. Ulrike Lucke (Universität Potsdam, stv. Sprecherin NFDIxCS) und Prof. Dr. Michael Goedicke (Universität Duisburg-Essen, Sprecher NFDIxCS) gaben zunächst einen Einblick in die Ziele und Aktivitäten des Konsortiums und führten in die drei Programmschwerpunkte ein: (1) Outreach & Community Building, (2) Metadaten & Forschungssoftware, (3) Knowledge Graphs & RDM-Container.

Zwei Impulsvorträge stimmten anschließend in die zu den Programmschwerpunkten durchgeführten Workshops ein:

  • Dr. Oliver Karras (TIB – Leibniz Informationszentrum für Technik und Naturwissenschaften / NFDI4Ing) stellte praktische Anwendungsfälle des Open Research Knowledge Graphs (ORKG) und ORKG Ask vor und zeigte, wie dieser in der NFDI und darüber hinaus genutzt werden kann.
  • Cord Wiljes (NFDI e.V. Geschäftsstelle) gab Einblick in die Verknüpfung der FDM-Helpdesks im NFDI-Netzwerk und sprach über bestehende Informations- und Supportdienstleistungen innerhalb der NFDI und darüber hinaus

Im Laufe des Tages nahmen die Teilnehmenden an drei Workshops teil: Workshop I konzentrierte sich auf „Outreach und Community-Building“, Workshop II erforschte „Metadaten und Forschungssoftware“ und Workshop III befasste sich mit „Wissensgraphen und RDM-Containern".

Diese Sitzungen boten wertvolle Einblicke und förderten die Zusammenarbeit innerhalb der Forschungsgemeinschaft. Die Diskussionsbeiträge bieten eine wichtige Grundlage für die weitere Arbeit innerhalb von NFDIxCS und in Zusammenarbeit mit weiteren FDM-Initiativen.

In Zukunft plant NFDIxCS weitere Symposien und einen intensiveren Austausch, um die Nutzung von Knowledge Graphs und LLMs in der Wissenschaft voranzutreiben. Wir danken allen Beteiligten für die spannenden Beiträge und freuen uns auf die Fortsetzung beim nächsten NFDIxCS Symposium im Frühjahr 2025.

Bis bald!


Workshop Highlights und Zusammenarbeit 

In den Workshops wurden auch Wissenschaftler und Experten aus anderen Konsortien, wie Text+ und NFD4DataScience, eingeladen, um gemeinsam Herausforderungen zu diskutieren, Verbindungen zu fördern und ein gegenseitiges Verständnis für Themen und Fortschritte zu vertiefen.

Im ersten Workshop, Outreach & Community Building, stellte Alexandra Resch (Gesellschaft für Informatik e.V.) das NFDIxCS Coffeetable Book vor, in dem internationale Akteur*innen langjährige Erfahrungen aus Forschungsdaten- und Forschungssoftwaremanagement ihrer verschiedenen Forschungsbereiche teilen. Christine Hennig (Fraunhofer FOKUS / NFDI4DataScience) sprach anschließend über gemeinsame Aufgaben von NFDI4DS und anderen NFDI-Konsortien, insbesondere NFDIxCS. Den dritten Impuls lieferte Cord Wiljes zur Vernetzung von NFDI mit anderen FDM-Organisationen, sowie zur Bedeutung von Community-Building-Maßnahmen innerhalb der Wissenschaft zur Etablierung einer gemeinsamen FDM-Praxis. Zu jedem Impuls und im letzten Teil jedes Workshops gab es eine angeregte und ausgiebige Diskussion, die im Anschluss zusammengefasst wird.

"Metadaten und Forschungssoftware" waren das Thema des zweiten Workshops: Jennifer Ecker (Leibniz-Insitut für Deutsche Sprache / Text erläuterte, wie sich Metadaten mit NLP-Methoden anreichern lassen. Dr. Eike Spielberg (Universität Duisburg-Essen) gab einen Impuls zu „SDG-Klassifikation von Publikationen. Von der Einzel- zur Massenklassifikation“ und Cord Wiljes lieferten dazu eine spannende Diskussion zur Etablierung von FDM-Metadaten-Standards.

Im dritten Workshop zu "Knowledge Graphs und RDM-Containern" präsentierten Dr. Oliver Karras, Angelika Kaplan vom Karlsruher Institut für Technologie und Maximilian Harms von der Universität Bayreuth spannende Ansätze, wie Knowledge Graphs und Large Language Models (LLMs) eingesetzt werden können, um den Zugang zu Forschungsdaten zu verbessern. Wie in den anderen Workshops gab es anschließend zu jedem Impuls und im letzten Teil ausgiebige Diskussionsmöglichkeiten.

 

Die Vorträge stehen über Nextcloud zur Verfügung:

 

Zusammenfassung der Diskussion

1. Workshop „Outreach & Community Building“: Entwicklung einer gemeinsamen Vision

Unter dem Motto „Die gemeinsame Vision schärfen: Beim FDM jetzt schon an die Jüngsten denken“ widmeten sich die verschiedenen Initiativen der weiteren Vernetzung ihrer Aktivitäten zur Etablierung eines besseren FDM. Eine Herausforderung und gleichzeitig großer Gewinn dabei ist die Vielzahl an beteiligten Partnern und Akteuren sowie die Überschneidungen in den verschiedenen Arbeitsbereichen.

Im exemplarischen Vergleich von NFDI4DS und NFDIxCS zeigte sich, dass die beiden Konsortien viele Parallelen haben, und dabei doch unterschiedliche Schwerpunkte setzen. Als Community-Aktivitäten planen beide etwa die Veranstaltung von sowie die Teilnahme an FDM Summer- und Winter-Schools. Darüber hinaus entwickelten sie Personas im Rahmen des Requirements Engineering. Bei näherer Betrachtung wird jedoch klar, dass sich die beiden Konsortien unterschiedlichen Herausforderungen und Lösungsansätzen widmen: Während NFDI4DS spezifisch auf die Anwendungsfelder der Data Science abzielt, konzentriert sich NFDIxCS auf die Bereiche Informatik und Software.

In der Diskussion wurde klar, dass ein Kulturwandel im FDM auf zwei Säulen aufbaut: Zum einen dem Erkennen und Adressieren domänenspezifischer Denkweisen. Denn um die jeweiligen Zielgruppen effektiv zu erreichen, ist es essenziell, deren spezifisches Vokabular und Bedürfnisse zu kennen. Zum anderen sollten FDM-Initiativen kontinuierlich und gemeinsam ihre geteilten Ziele verfolgen. FDM sollte dabei systematischer verankert und z. B. mit Workshops in Doktorand*innen-Kolloquien integriert werden. Zudem sollte das Engagement im FDM dringend mehr Anerkennung finden.

Der kollaborative Ansatz kann sich auf etablierte Strukturen stützen: Hierzu zählen die intensivere Nutzung überregionaler und internationaler Netzwerke und die Anknüpfung an neue Communitys:

  • Die NFDI-Konsortien und der NFDI e.V. spielen eine zentrale Rolle bei der Herstellung von Verbindungen. So ist der NFDI e.V. etwa Mitglied der European Open Science Cloud Association (EOSC), die internationale Kooperationsmöglichkeiten bietet.
  • Die Research Data Alliance (RDA) und RDA Deutschland, beides Vereine mit nationalen und internationalen Vernetzungsstrukturen, bieten zusätzliche Anknüpfungspunkte für Interessierte.
  • Es besteht auch die Möglichkeit, durch das Verfassen von Beiträgen eine Zusammenarbeit mit Plattformen wie forschungsdaten.info und forschungsdaten.org zu initiieren.
  • Ein zentrales Event für das Forschungsdatenmanagement ist die Love Data Week, eine offene, internationale Veranstaltung, an der Beteiligung rege erwünscht ist. Nähere Informationen hierzu sind auf forschungsdaten.org zu finden.
  • Forschungsdatenmanagement wird auch auf Landesebene koordiniert. FDM-Landesinitiativen sorgen für die Organisation von FDM-Projekten und bieten in der Regel Schulungen und Informationen an. Ein Beispiel dafür sind HeFDI (Hessische Forschungsdateninfrastrukturen), die regelmäßig virtuelle Veranstaltungen wie die HeFDI Code School veranstalten. Eine stärkere Vernetzung der Landesinitiativen mit anderen nationalen und internationalen FDM-Initiativen ist ein erklärtes Ziel.
  • Über die Wissenschaft hinaus sind die Zivilgesellschaft und Industrie spannende Zielgruppen. Eine verstärkte Vernetzung mit Civic Coding Initiativen und kommerziellen Verlagen wäre wünschenswert. Durch die Präsenz auf Veranstaltungen wie der Berlin Science Week oder ähnlichen offenen Events können neue Partnerschaften geknüpft werden.

NFDIxCS Symposium: PostIts zum Workshop Community Building

 

2. Workshop „Metadaten & Forschungssoftware“: Auf dem Weg zur Etablierung von Metadatenstandards

Der Etablierung von Metadatenstandards stellen sich verschiedene Herausforderungen: Erstens braucht es für eine erfolgreiche Standardisierung klare Prozesse und engagierte Communitys, die diese anwenden. Da die Durchsetzung neuer Standards für Initiativen zweitens kaum möglich ist, etablieren sich neue Praktiken eher auf Basis von Empfehlungen oder Best Practices. In einem Spannungsverhältnis stehen drittens die Notwendigkeit, sinnvolle disziplinäre Standards zu erhalten und der Wunsch, übergreifende Standards zu schaffen. Dabei müssen Metadatenstandards auf internationaler Ebene gedacht und verstanden werden. Entstehen neue Standards für Deutschland, können sie durch etablierte Prozesse in die deutsche Wissenschaft integriert werden.

Zu den gängigen Datenstandards zählen unter anderem der beliebte Standard Dublin Core, der oft genutzte DCAT-Standard des W3C und die etablierten Standards auf schema.org für strukturierte Daten im Internet. Data Cite ist zwar gesetzt, wird jedoch zu selten verwendet. Für Software gibt es den spezifischen Standard SPDX. Forschende in text+ arbeiten an linked data, also Daten die mit anderen Datenbanken, wie etwa Wikidata, verlinkt sind.

In Bezug auf Metadaten-Praktiken sorgten insbesondere automatisierte Verfahren für intensive Diskussionen:

Durch den Einsatz von Knowledge Graphs könnte es möglich werden, Metadaten automatisch zu generieren, welche die Nähe eines Artefakts zu anderen Artefakten ausdrücken. Es wäre auch spannend, Nicht-Text mit semantischen Metadaten anzureichern.

Eine zentrale Frage, die sich dabei stellt, ist, inwieweit der Mensch noch gebraucht wird, um eine hohe Korrektheit zu erreichen. Aktuelle automatische Systeme weisen eine hohe Fehlertoleranz auf, was eine Kontrolle durch Autor*innen notwendig macht. Die manuelle Qualitätssicherung solcher Metadaten ist jedoch ressourcenintensiv. Hier wurde vorgeschlagen, Kräfte zu bündeln, um spezialisierte Datenkurator*innen einzustellen.

Auch der Einsatz von künstlicher Intelligenz (KI) spielt eine große Rolle in der Metadaten-Generierung. Ein Symposiums-Gast merkte an: „Hier laufen wir der Technik hinterher.“ Man wünscht sich automatisierte oder halbautomatisierte Systeme zur Metadaten-Generierung, beispielsweise als Add-On für NFDIxCS. Um die Qualität der Metadaten zu erhöhen, sollten verschiedene Ansätze zur Generierung gemeinsam entwickelt werden. Ein Computer könnte beispielsweise erste Metadaten generieren, die dann von Autor*innen und Kurator*innen ergänzt und überprüft werden. Für eine effektive Qualitätssicherung von Metadaten könnten sogenannte Meta-Meta-Daten eingeführt werden, welche dokumentieren, wie die Metadaten erstellt und kontrolliert wurden.

Gütekriterien für Metadaten, die in den Meta-Meta-Daten festgehalten werden, sollen gemeinsam entwickelt werden. Diese könnten unter anderem Informationen zur Datenannotation und Kuration umfassen.

Eine spannende Möglichkeit für konsortiumsübergreifende Zusammenarbeit bietet die NFDI-Sektion „Metadata“. Diese arbeitet an zentralen Fragen zu Metadatenstandards und -anwendungen. Das nächste Sektionstreffen ist für Dezember geplant, weitere Informationen sind auf nfdi.de/section-metadata/ verfügbar. Das Thema Research Software und die dazugehörigen Metadaten nimmt auch im NFDI-Basisdienst nfdi.software einen besonderen Raum ein. Auch hier spielt die Qualitätssicherung eine wichtige Rolle, um den Umgang mit Metadaten effizienter und nachhaltiger zu gestalten.

NFDIxCS Symposium: PostIts zum Workshop Metadaten & Forschungssoftware

 

3. Workshop „Knowledgegraphs & RDM-Container“: Wissenschaft verbessern durch Wissensgraphen

Der Workshop befasste sich zusammenfassend mit der Vision, die Wissenschaft durch den Einsatz von Knowledge Graphs langfristig zu verbessern und zugänglicher zu machen. Ein zentraler Fokus lag dabei auf dem Knowledge Graph ORKG und der Plattform ORKG Ask, die für Publikationen, Daten und Software geeignet sind. Beide Systeme nutzen künstliche Intelligenz: Während der ORKG „AI-augmented“ ist, ist ORKG Ask vollständig „AI-driven“. Diese KI-Unterstützung soll dazu beitragen, Wissen effizienter zu organisieren und zugänglicher zu machen, als es heute mit herkömmlichen PDF-Papers möglich ist. Die Knowledge Graphs dienen als Brücke zwischen verschiedenen wissenschaftlichen Artefakten und schaffen so eine neue, umfassendere Art der Wissensrepräsentation. Um Knowledge Graphs sinnvoll nutzen zu können, brauche insbesondere für junge Wissenschaftler*innen eine gemeinsame Wissensbasis.

Eine der großen Herausforderungen ist es, den Import von Daten in Knowledge Graphs weiter zu automatisieren. Ziel ist es, Klassifikationen korrekt zu erkennen und Vorschläge zu generieren. Ein Problem, das während der Diskussion deutlich wurde, ist, dass zwar Titel und Abstracts meist in Knowledge Graphs zugänglich sind, jedoch häufig Lücken bestehen. Volltexte sind meistens nicht verfügbar, und auch die Nutzung von Abstracts stößt aufgrund von Urheberrechtsproblemen an Grenzen. Zum Teil wurden Verträge geschlossen, um Abstracts nutzen zu dürfen. Ein Gast merkte jedoch an, dass die wichtigsten Informationen einer Publikation oft nicht im Abstract enthalten seien. Das wurde auch bei den demonstrierten Knowledge Graphs deutlich: Wichtige Metadaten sind häufig nicht verlässlich extrahierbar. Es bleibt außerdem die Frage offen, wie nicht-maschinenlesbare Publikationen für Knowledge Graphs nutzbar gemacht werden können.

Im Rahmen des Workshops wurden insgesamt drei verschiedene Schemata für den Input in Knowledge Graphs vorgestellt. Dabei wollen die jeweiligen Teams ihre Arbeiten vergleichen, voneinander lernen und kooperieren. Besonders im Bereich der Abstract-Extraktion wird eine Zusammenarbeit zwischen der TIB und der Universität Bayreuth angestrebt, um die KI-Modelle durch größere Testdatensätze zu verbessern. In Bezug auf die Optimierung und den Einsatz von KI merkte ein Symposiums-Gast abschließend an, dass es möglicherweise nicht mehr lange dauern werde, bis man aus den Ergebnissen und Annotationen eines Knowledge Graphs ein vollständiges Paper generieren könne.

Die Ontologie eines Knowledge Graph war ein weiteres viel diskutiertes Thema. Ein zentrales Problem ist das sogenannte Multilabelling Problem sowie die Frage nach der Maintenance. Verschiedene Knowledge Graphs, wie Wiki Data und ORKG, nutzen unterschiedliche Ontologien. Dabei stellte sich die Frage, wie man mit der Vielzahl von Ontologien in verschiedenen Knowledge Graphs umgehen sollte. Es wurde vorgeschlagen, einfache Ontologien zu verwenden, um Interoperabilitätsprobleme zu vermeiden. In einem der vorgestellten Modelle wird ein Paper etwa durch Object, Property und Method beschrieben. Zudem sollten die Ontologie, die Artifact Evaluation und der Review-Prozess besser miteinander verknüpft werden.

Doch benötigen Knowledge Graphs überhaupt eine Ontologie, wenn es doch Large Language Models (LLMs) gibt? Auch diese Frage wurde diskutiert. Die vorläufige Antwort lautet: ja. LLMs können KGs derzeit nur ergänzen. Forschungsdaten liegen häufig nicht in natürlicher Sprache, ohne dazugehörigen Paper, vor und sie sind deshalb nur schwer mit LLMs erfassbar. Außerdem sind LLMs derzeit noch nicht zuverlässig genug. Derzeit sei die wissenschaftliche Nutzung von LLMs nur durch sehr spezifisches Prompt-Engineering möglich. Mit passenden Ontologien könnte jedoch die Zuverlässigkeit von LLMs erhöht werden. Eine Mitarbeiterin des KIT sprach sich für einen hybriden Ansatz aus, der sowohl Knowledge Graphs als auch LLMs nutzt: „Es wäre derzeit ein Fehler, sich auf das eine oder andere Modell zu beschränken. Das Verhältnis muss jedoch laufend evaluiert werden.“

Auch die semantische Modellierung von Forschungsartefakten in Knowledge Graphs ist ein großes Thema. Mitarbeitende des Konsortiums NFDIxCS, die an Metadatenstandards arbeiten, beschäftigen sich mit der Frage, wie ein kleinster gemeinsamer Nenner zwischen den verschiedenen Subdisziplinen der Informatik gefunden werden kann. Ein Symposiums-Teilnehmer schlug vor, den Forschungsgegenstand noch weiter zu fassen und disziplinübergreifend zu denken, da Knowledge Graphs für viele Domänen von Bedeutung sind, nicht nur für die Informatik.

Eine Herausforderung ist dabei die uneinheitliche Terminologie zwischen verschiedenen Disziplinen. Begriffe wie Theorie und Modell werden disziplinspezifisch und sehr unterschiedlich verstanden. Es bräuchte einen systematischen Vergleich zwischen möglichst unterschiedlichen Disziplinen und vertiefte wissenschaftssoziologische Erkenntnisse, um sich einem möglichst allgemeinen Modell anzunähern.

 

NFDIxCS Symposium: PostIts zum Workshop Knowledge Graphs & RDM - Container

The participants of the 1st NFDIxCS Symposium