Task area

64 Big Data: digitalisierte Zeitungen

Ich möchte einen großen Datensatz von digitalisierten Zeitungen analysieren. Mein Forschungsvorhaben soll die Volltexte im Hinblick auf Veränderungen thematischer Schwerpunkte in der Berichterstattung untersuchen und darüber hinaus auch eine Analyse des verwendeten Bildmaterials beinhalten. Die Daten sollen von verschiedenen Archiv- und Bibliotheksservern aggregiert werden. Die Datenmenge ist für meinen lokalen Rechner zu groß, außerdem sind die Algorithmen aus dem Bereich des maschinellen Lernens, die ich für die Analyse verwenden möchte, sehr rechenintensiv. Wo finde ich eine Institution, die mein Vorhaben mit der notwendigen Hardwareausstattung und Rechenleistung unterstützen kann?

Task Area

Perspective

dataprocessing

Tags

digitale Text- und Bildanalyse
Maschinelles Lernen
Hardware/Rechenleistung

63 Forschungssoftware

< Back to problem stories

Wesentlicher Kern der Digital Humanities ist die Entwicklung und Erforschung digitaler Methoden zur Beantwortung geisteswissenschaftlicher Fragestellungen. Softwareentwicklung stellt in diesem Zusammenhang einen zentralen Bestandteil der Forschungspraxis dar. Nicht selten ist dabei die Entwicklung eines Algorithmus, einer Schnittstelle oder eines Softwarepaketes die eigentliche wissenschaftliche Leistung. Forschungssoftware entsteht in einem komplexen, kreativen, kombinatorischen und oft kollaborativen Prozess, der durch zahlreiche Abhängigkeiten zu anderen Ressourcen und Softwarekomponenten gekennzeichnet ist. Im Gegensatz zu klassischen Forschungsdaten ist der Lebenszyklus von Forschungssoftware wesentlich kürzer und weitaus anfälliger für „äußere Einflüsse“. Zum einen wird Forschungssoftware häufig nur zur kurzfristigen Erzeugung oder Verifikation von Forschungsergebnissen erstellt, zum anderen leidet sie unter der oft begrenzten Förderdauer von Projekten. Themen wie das Überarbeiten von Quellcode, um eine bessere Wartbarkeit zu erzielen, oder das Erstellen von Dokumentationen und Tutorials werden aus Zeitgründen häufig nicht in ausreichendem Maße berücksichtigt. Zudem fallen bei Auslauf der Projektmittel die Softwareentwickler*innen als notwendige technische Expert*innen weg, so dass die Software nicht mehr gepflegt wird und schnell veraltet. Als spezielle Art von Forschungsdaten stellt Software besondere Herausforderungen an den Entwicklungsprozess und an ein nachhaltiges Datenmanagement. Die Anerkennung von Software als Forschungsergebnis sowie die Schaffung institutioneller Strukturen, die Softwareentwickler*innen verlässliche Karrierewege ermöglichen und nicht zuletzt die Integration von Software in nachhaltige Forschungsdateninfrastrukturen würden maßgeblich zu einer qualitativ besseren Forschungspraxis beitragen.

Task Area

Perspective

Tags

Softwareentwicklung
Forschungssoftware als wissenschaftliche Leistung

62 Ortsverteilte Erfassung und virtuelle Präsentation nicht lateinschriftlicher Musikquellen + Digitale und analoge Edition

< Back to problem stories

Eine Gruppe von Forschenden untersucht im Rahmen eines Drittmittelprojekts orientalische Musik des 19. Jahrhunderts. Die Musikstücke liegen in analoger Form in verschiedenen Handschriften und Drucken vor, wobei teilweise unterschiedliche Quellen für ein und dasselbe Werk existieren. Die Quellen befinden sich an verschiedenen Standorten im nicht europäischen Ausland. Das Material weicht sowohl von sprachlichen als auch musikalischen Standards ab: in den Handschriften und Drucken mischen sich unterschiedliche nicht lateinische Sprachen und Schriftzeichen (mit einigen historischen Sonderzeichen), die historische Musiknotation entspricht ebenfalls nicht dem westeuropäischen Notationsstandard. Die Forschenden möchten einen einschlägigen Quellenkatalog aufbauen und im Internet zugänglich machen. Dabei stehen sie vor dem Problem, ein geeignetes technisches System zu finden, das die spezifischen sprachlichen und musikwissenschaftlichen Anforderungen der Quellen erfüllt. Zudem fragen sie sich, welche Metadaten dafür notwendig sind und wie man diese standardisiert in mehreren Sprachen und Schriftsystemen ortsverteilt erfassen und darstellen kann. Ferner stellt sich die Frage, wie man den Quellenkatalog langfristig sichern und funktionsfähig halten kann. Darüber hinaus entscheiden sich die Forschenden dafür, die Handschriften und Drucke gedruckt und online zu veröffentlichen. Hierbei stehen sie zunächst vor dem Problem, den Quellenkatalog für diesen Zweck anpassen zu müssen, um die digitalen Editionen virtuell präsentieren zu können. Unklar ist, inwiefern eine Erweiterung des Quellenkatalogs genügt oder ob stattdessen ein neues System dafür notwendig ist. Zudem wissen die Projektbeteiligten nicht, welche Standards für historische Editionen gelten, insbesondere für historische Musikeditionen und welche Editionswerkzeuge und -systeme die spezifischen sprachlichen und musikwissenschaftlichen Anforderungen des Quellmaterials erfüllen können. Ferner fehlt im Projekt ein Workflow, um ausgehend von dem analog vorliegenden Quellenmaterial digitale und gedruckte Editionen zu erstellen. Schließlich ist den Forschenden nicht klar, wie eine langfristige Sicherung der digitalen musikhistorischen Editionen sichergestellt werden kann.

Task Area

Perspective

Tags

nicht lateinische Schriften
digitale Musikedition
digitale Textedition

60 Historische Grenzen und Raumordnungen

< Back to problem stories

Unser Online-Quellenportal bietet neben Text- und Bildquellen auch eine Vielzahl von Karten, die die wechselnden Grenzen und politischen Einheiten des heutigen Deutschlands von der Frühen Neuzeit bis in die Gegenwart zeigen. Statt statischer Karten erwarten durch Google Maps und ähnliche Dienste geprägte Nutzer*innen von einem modernen Internet-Angebot zunehmend dynamische Karten, die das Heran- und Wegzoomen bestimmter Gegenden, dynamische Animationen von Grenzverschiebungen im zeitlichen Verlauf sowie die interaktive Einblendung von Zusatzinformationen wie etwa die Lebenswege bestimmter Personen unterstützen. Programmbibliotheken wie leaflet.js ermöglichen es, solche Funktionalitäten sowohl auf aktuellen Luftbildkarten als auch mit retro-digitalisierten historischen Karten im Hintergrund zu realisieren. Uns fehlt aber ein historisches Geoinformationssystem, das die häufig wechselnden Landes- und Gebietsgrenzen in Europa und insbesondere in Deutschland über die letzten Jahrhunderte (Altes Reich, Napoleonisches Zeitalter, Deutscher Bund, Reichsgründung, Weimarer Republik, Deutsche Teilung, Neue Bundesrepublik) mit den entsprechenden Territorien (Fürsten- und Herzogtümer, Königreiche, Bundesstaaten, (Bundes-)Länder und Bezirke) in passenden Formaten hinreichend exakt und unter einer freien Lizenz bereitstellt.

Task Area

Perspective

Tags

Historische Karten
Geoinformationssystem

59 Sicherung der einheitlichen Erfassung von Metadaten für Forschungsdaten

< Back to problem stories

Als Forschungsdatenkurator möchte ich die einheitliche Beschreibung von Forschungsdaten mit Metadaten durch die Forschenden kontrollieren und sichern, um die Forschungsdaten möglichst gut wiederauffindbar zu machen. Wie gewährleiste ich eine einheitliche Beschreibung von Forschungsdaten, die von verschiedenen Wissenschaftlern aus verschiedenen disziplinären aber auch interdisziplinären Arbeitsgruppen kommen? Eine brauchbare technische Plattform, die mich beim Einrichten von Workflows für Metadaten-Review bzw. Qualitätskontrolle der Daten und Metadaten unterstützt, scheint es derzeit noch nicht zu geben.

Task Area

Perspective

datapublication

Tags

Metadaten-Qualität
Forschungsdatenmanagement-Workflow
Metadaten-Review

58 Einsatz von Normdaten und kontrolliertem Vokabulare zur fachspezifischen Beschreibung von Forschungsdaten

< Back to problem stories

Als Forschungsdatenkurator möchte ich Normdaten und kontrollierte Vokabulare verwenden, um Forschungsdaten möglichst fachspezifisch und mit anderen Ressourcen integrierbar zu beschreiben. Normdaten wie insbesondere die GND wären für eine effiziente Erfassung von Autoren und Forschungseinrichtungen per Autovervollständigung sehr naheliegend. Leider fehlt dafür ebenso wie für den Einsatz kontrollierter Vokabulare oft eine Unterstützung durch die technischen Plattformen. So muss man z.B. im DataCite-Editor des DHVLab der LMU die GND-IDs umständlich über OGND heraussuchen und manuell in das Eingabeformular eintragen. Kontrollierte Vokabulare sollten möglichst im SKOS-Format eingebunden werden können, da viele relevante Klassifikationssysteme, Thesauri und Gazetteers in diesem Format vorliegen, wie etwa das für historische Forschung relevante HISCO oder ICONCLASS oder auch PeriodO als Verzeichnis historischer Perioden. Am ehesten scheint noch die Web Publishing-Plattform Omeka S mit dem Value Suggest-Modul diese Anforderungen zu erfüllen. Es wäre wünschenswert, wenn im Rahmen von 4Memory entsprechende Module für bestehende Systeme oder Eigenentwicklungen entstehen würden, die diese für die Metadatenkuration sehr naheliegenden Anforderungen erfüllen.

Task Area

Perspective

datapublication

Tags

Normdaten
kontrolliertes Vokabular
SKOS (Linked Data)

57 Virtuelle Veröffentlichung von Quellen und Forschungsergebnissen in einem Blog

< Back to problem stories

Eine Gruppe von Forschenden der Geschichtswissenschaft möchte ihre Forschungsergebnisse sowie einige Quellen (Texte, Bildmaterial) veröffentlichen. Da für die Publikation keine Finanzmittel zur Verfügung stehen, suchen sie ein Publikationsmedium im Internet, das keine Kosten verursacht, aber dennoch gut und auch international sichtbar ist. Dabei ist ihnen wichtig, den Veröffentlichungsprozess zwar komplett ohne fremde Hilfe, zugleich aber zeitversetzt und kollaborativ durchführen zu können. Zudem sollen die Veröffentlichungen im Internet frei nutzbar und gut auffindbar sein. Auch eine Kommentarfunktion wäre hilfreich, um die wissenschaftliche Diskussion zu beflügeln. Da die Publikationen nur online erscheinen, ist den Forschenden eine nachhaltige Sicherung der veröffentlichten Inhalte wichtig. Nach reiflicher Überlegung entscheiden sich die Forschenden für einen wissenschaftlichen Blog. Die Forschenden stehen vor folgenden Problemen: • Sie haben nur eingeschränkte Kenntnisse von Websystemen bzw. Webentwicklung, allerdings auch keine finanziellen Mittel, um dies in Auftrag zu geben oder jemanden dafür einzustellen. • Die Forschenden wissen nicht genau, welche Kriterien bei der Auswahl solcher Systeme wichtig sind. Daher ist ihnen nicht klar, welches System sich für ihre Bedarfe eignet und dabei auch in der Handhabung einfach ist. • Die Forschenden haben die Befürchtung, dass ihre im Internet veröffentlichten Forschungsergebnisse und Quellen mangels finanzieller Mittel irgendwann verschwinden, unter anderem weil das System, in dem die Ergebnisse präsentiert werden, veralten könnte. Sie wissen jedoch nicht, wie sie dem vorbeugen können.

Task Area

Perspective

Tags

Blog
Online-Publikation
Open Acces

56 Schulung und Beratung im Bereich Geoinformationssystem (GIS)

< Back to problem stories

Eine Forscherin möchte gerne Geodaten, die sie aus einem gedruckten Textkorpus extrahiert hat, auf einer interaktiven Karte visualisieren. Die Daten sollen anschließend als .csv für die Forschung zur Verfügung gestellt werden. Konkret steht sie vor der Frage, welche der zahlreichen angebotenen Tools für ihre Zwecke das Geeignetste ist oder ob etwas Eigenes programmiert werden muss. Wichtig ist ihr, die Geodaten auf einer historischen Karte zu zeigen, nicht auf einer aktuellen. Sie fragt sich auch, wie sie internationale Normdaten verwenden kann, welche internationalen Gazetteers/historische Ortslexika es bereits gibt und wie und wo die Webansicht sowie die Daten nachhaltig gespeichert werden können. Gerne würde sie sich von kompetenter Seite Rat holen und an einer Schulung zu GIS einerseits und einer Einführung in die Nutzung eines konkreten Tools - sofern für ihren spezifischen Zweck vorhanden - andererseits teilnehmen.

Task Area

Perspective

Tags

Geoinformationssystem
Karten
Normdaten

55 Digitale Textanalyse in internationalen historischen Zeitungen

< Back to problem stories

Eine Gruppe von Forschenden möchte den sprachlichen Wandel rund um das Thema “Politikverdrossenheit” in internationalen historischen Zeitungen des 19. und 20. Jahrhunderts untersuchen. Die Zeitungen liegen in Teilen digitalisiert vor, allerdings auf unterschiedlichen, internationalen Plattformen. Nicht alle sind im Volltext erfasst. In Teilen gibt es sie nur gedruckt. Die Gruppe steht vor folgenden Problemen: • Wie kann sie die großen Mengen an Zeitungsartikeln unterschiedlicher Herkunft mit wenig Aufwand und unter Einhaltung des jeweiligen Urheberrechts zu einem Corpus zusammenfügen? • Wie kann sie das Corpus für die digitale Analyse vorbereiten und mit internationalen Normdaten anreichern? • Wie kann sie eine digitale Analyse des Corpus vornehmen? • Wo und wie können die Daten anschließend gespeichert werden, so dass die erarbeiteten Forschungsergebnisse nachvollziehbar sind?

Task Area

Perspective

Tags

Digitale Textanalyse
Internationale Zeitungen

54 Projektbezug und Zusammenhang mit anderen Ressourcen herstellen

< Back to problem stories

Als Forschungsdatenkurator möchte ich ich Forschungsdatensätze und weitere Ressourcen miteinander verknüpfen, um den Entstehungszusammenhang und die Beziehungen zu weiterem Forschungsoutput sichtbarer zu machen. Eine Mindestanforderung ist dabei z.B. die Berücksichtigung der DataCite-Relationstypen IsReferencedBy, IsCitedBy und IsSupplementTo zur Verbindung von Forschungsdaten mit zugehörigen Forschungspublikationen, aber auch Relationen wie IsDerivedFrom, IsSourceOf und IsVersionOf, die den Entstehungszusammenhang zwischen Datensätzen beschreiben. Die Verknüpfung der Ressourcen würde idealerweise mit einem (auch für die datengebenden Fachwissenschaftler einfach zu benutzenden) graphischen Editor stattfinden. Die bisher einzige Open Source-Lösung dafür scheint allerdings die mittlerweile veraltete Erweiterung ckanext-lire (LInked RElationships) für CKAN zu sein (siehe auch zugehörigen Konferenzbeitrag). Wichtig für ein Werkzeug zur Kontextualisierung von Forschungsdatensätzen wäre auch die Einbindung von Forschungsinformationssystemen bzw. auch Bibliothekskatalogen. Insbesondere der Projektkontext könnte durch die Anbindung eines Forschungsinformationssystems hergestellt werden. In Bibliothekskatalogen erfasste Publikationen können über deren DOI oder auch ISBN bzw. den permanenten Links zu den entsprechenden Katalogeinträgen verlinkt werden. Idealweise wird die Verknüpfung von Datensätzen und Publikationen durch Linked Data unterstützt. Für den Projektkontext kommen dazu Ontologien wie PROV-O, FRAPO, VIVO-ISF oder auch die Scholarly Ontology in Frage.

Task Area

Perspective

datapublication

Tags

Forschungsinformation
Provenienzinformation
graphischer Editor