Die zweite GGSG-Sommerschule „Von der Handschrift zum digitalen Korpus“ widmet sich den Schritten, die nötig sind, um historische Handschriften oder Drucke für ein Korpus zusammenzustellen, zu digitalisieren, mittels Annotationen anzureichern sowie für (linguistische) Korpusanalysen aufzubereiten. Zielgruppe sind interessierte Wissenschaftler:innen der historischen Linguistik, die für eigene Qualifikationsarbeiten oder in Drittmittelprojekten Know-how zur Korpusgewinnung und -auswertung benötigen.
Die Sommerschule kombiniert Workshops zu einzelnen Arbeitsschritten und Technologien mit angeleiteten Selbstlernphasen für die individuelle Vertiefung des Gelernten sowie mit Vorträgen, welche umfangreichere Einblicke und Überblicke zu den behandelten Themen geben.
Wichtige Informationen
GGSG-Sommerschule „Von der Handschrift zum digitalen Korpus“
Montag, 21. September bis Freitag, 25. September 2026
Neues Seminargebäude der Universität Leipzig, Universitätsstraße 1, 04109 Leipzig
Anfahrt vom Hauptbahnhof mit ÖPNV:
- Tram 4 Richtung Stötteritz, Ausstieg: Augustusplatz
- Tram 7 Richtung Sommerfeld, Ausstieg: Augustusplatz
- Tram 12 Richtung Johannisplatz, Ausstieg: Augustusplatz
- Tram 15 Richtung Meusdorf, Ausstieg: Augustusplatz
Promovierende der Historischen Sprachwissenschaft und anderer historisch arbeitender Fächer, auch Master- und Bachelorstudierende
- Teilnehmende: max. 30 Personen
- Preis: 30 € pro Person
Die Lehrsprache ist Deutsch.
Anmeldung
Anmeldungen sind nicht mehr möglich.
Programm
Das vorläufige Programm der Sommerschule finden Sie rechts im Download-Bereich.
Expert:innen
Worum geht’s?
Modul 1 ist der ersten Phase im Forschungsdatenzyklus gewidmet, in der die Handschriften bzw. Drucke nach der Digitalisierung transkribiert und zur weiteren Aufbereitung vorbereitet werden. Im Zentrum steht die Anwendung von Transkribus zur digitalen Transliteration und Layout-Annotation, in die im ersten Teil eingeführt wird. Im zweiten Teil wird an ausgewählten Texten gearbeitet, um das PAGE-XML-Format, das die Grundlage für die Annotation im Modul 2 bildet, zu erstellen.
Wer lehrt?
Prof. Dr. Renata Szczepaniak ist Professorin für Historische Sprachwissenschaft des Deutschen an der Universität Leipzig.
Worum geht’s?
In Modul 2 beschäftigen wir uns mit der Annotation digitalisierter Volltexte. Annotationen bieten die Möglichkeit, strukturierte Informationen über Texte und Textteile abzulegen, auf die später mit automatisierten Verfahren quantitativ zugegriffen werden kann. Im Kurs lernen wir XML als Annotationsstandard kennen und nutzen insbesondere das verbreitete TEI-XML-Format. Wir annotieren selbst digitalisierte Volltexte nach verschiedenen Kategorien, automatisiert und manuell, lernen entsprechende Tools kennen, die diese Aufgaben unterstützen, und erarbeiten uns dabei die Grundlagen für die TEI-Textauszeichnung.
Wer lehrt?
Dr. Susanne Haaf-Dumont ist wissenschaftliche Mitarbeiterin und Lehrkraft an der Universität Leipzig.
Worum geht’s?
Die ersten Schritte – die Digitalisierung (Modul 1) und die Annotation (Modul 2) – sind wichtig und typisch für den Forschungs(daten)zyklus digitaler Editionen. Modul 3 widmet sich dem Erschließen und der Dokumentation der Textdaten mit Metadaten sowie den Konzepten der Datenmodelle, -repräsentationen und -formate, die wiederum in der Planung von Forschungsprojekten mit Textdaten wesentliche Vorüberlegungen erfordern (Modul 3, Block 1). Wie plane ich meine Datenarbeit, welche Workflows müssen mitgedacht werden? Dies betrifft auch die Klärung der Rahmenbedingungen für die notwendige Infrastruktur (u. a. Tools, Plattformen). Mit einer Einführung in das Forschungsdatenmanagement und Governance lernen wir erste praktische Schritte dafür kennen. Mit einem Exkurs in den Bereich der KI-Systeme und KI-Regelungen schließt dieses Modul (Modul 3, Block 2).
Wer lehrt?
Dr. Carolin Odebrecht ist Geschäftsführerin des Interdisziplinären Zentrums für Digitalität und digitale Methoden und Beauftragte für Forschungsdatenmanagement an der Sprach- und literaturwissenschaftlichen Fakultät an der Humboldt-Universität zu Berlin.
Worum geht’s?
Das Modul 4 führt in die maschinelle Analyse von Korpusdaten anhand grundlegender Text- und XML-basierter Methoden ein. Hierzu gehören reguläre Ausdrücke, die von fast jedem Textverarbeitungsprogramm unterstützt werden und mächtige Volltextsuchen ermöglichen. Reguläre Ausdrücke bilden auch die konzeptionelle Grundlage für diverse Anwendungen zur Korpusanalyse. Daneben betrachten wir XPath, eine leistungsstarke Abfragesyntax zur Suche und Navigation in XML-Strukturen. Beide Verfahren der Abfrage lassen sich auch kombinieren, sodass gezielte Suchen nach komplexen Ausdrücken in TEI-basierten Korpora möglich werden.
Wer lehrt?
Peter Stadler ist Geschäftsführer am Zentrum Musik – Edition – Medien (ZenMEM) der Universität Paderborn.
Dr. Susanne Haaf-Dumont ist wissenschaftliche Mitarbeiterin und Lehrkraft an der Universität Leipzig.
Worum geht’s?
Das Modul 5 gibt eine Einführung in Webtechnologien (HTML, CSS, Javascript), um den Teilnehmenden die Grundlagen für eine Online-Publikation der Korpusdaten an die Hand zu geben. Anschließend werden spezielle Tools (TEI Stylesheets, CETEIcean, TEI Publisher) vorgestellt, die speziell zur Publikation von TEI-Daten entwickelt wurden. Mithilfe der im ersten Schritt erlernten Webtechnologien lassen sich die Ausgaben der Tools dann an die spezifischen Erfordernisse der eigenen Korpusdaten anpassen.
Wer lehrt?
Peter Stadler ist Geschäftsführer am Zentrum Musik – Edition – Medien (ZenMEM) der Universität Paderborn.
- Kathrin Heil: Akquise. Quellen finden in Archiven
Die Fähigkeit vielfältige Quellen unterschiedlicher Herkunft zu ermitteln und dabei auf alltägliche und besondere Texte zu stoßen, bildet die Basis sprachwissenschaftlicher Forschung. Die Fülle der uns heute zur Verfügung stehenden Informationsmöglichkeiten ist für die Suche nach Quellen einerseits von Vorteil, erschwert andererseits aber deren gezieltes Auffinden.
Der Vortrag wird den Weg durch die deutsche Archivlandschaft weisen. Er informiert über Struktur und Arbeit von Archiven, stellt einschlägige Webportale vor, erläutert den Ablauf einer Recherche und gibt Auskunft zu Planung und Verlauf eines Archivbesuches.
— Kathrin Heil ist Referentin am Sächsischen Staatsarchiv/Staatsarchiv Leipzig. - Matthias Boenig: Techniken und Tools für die OCR
Die Vervolltextung mit Hilfe der optischen Zeichenerkennung (OCR) hat sich in über drei Jahrzehnten zu einer zentralen Technologie der digitalen Transkription in Bibliotheken, Archiven und den Wissenschaften entwickelt. In diesem Zeitraum kamen unterschiedliche Verfahren zum Einsatz, die von regelbasierten Ansätzen des Mustervergleichs bis hin zu modernen Deep‑Learning‑Modellen reichen. Der Beitrag bietet einen Überblick über grundlegende Techniken – darunter Bildvorverarbeitung, Layoutanalyse, Segmentierung und modellbasierte Texterkennung – sowie über etablierte Tools.
Ein weiterer Aspekt betrifft das Forschungsdatenmanagement (FDM), insbesondere im Umgang mit Trainings‑, Referenz‑ und Evaluationsdaten (Ground‑Truth‑Daten). Die nachhaltige Organisation, Versionierung und Dokumentation dieser Daten ist entscheidend für Reproduzierbarkeit, Vergleichbarkeit und langfristige Nutzbarkeit automatischer Transkriptionsverfahren. Ergänzend werden Verfahren der Qualitätssicherung vorgestellt, darunter Metriken wie Character Error Rate (CER) und Word Error Rate (WER).
— Matthias Boenig arbeitet als Koordinator Retrodigitalisierung in der Abteilung Digitale Dienste an der Universitäts- und Landesbibliothek Sachsen-Anhalt. - Tobias Kraft: Unterwegs mit der edition humboldt digital. Ein editionsphilologischer Reisebericht (2015–2032)
Was ist eine digitale Edition und was bedeutet es, wenn man für ihre Entwicklung 18 Jahre Zeit bekommt? Darauf antwortet der Vortrag am Beispiel der hybriden edition humboldt. Die edition humboldt ist ein Langzeitvorhaben der Berlin-Brandenburgischen Akademie der Wissenschaften zu den Reisetagebüchern und Nachlassdokumenten des preußischen Forschungsreisenden Alexander von Humboldt (1769 –1859). Die Ergebnisse werden in verschiedenen Ausgabeformaten veröffentlicht: als Buchreihe, als digitale Edition und als strukturierter Datensatz in TEI/XML. Neben konzeptionellen Fragen zur Hybrid-Edition und der Entwicklung neuer Funktionen wird auch die Zukunft digitaler Editionen nach Ende ihres Förderzyklus beleuchtet.
— Dr. Tobias Kraft ist Arbeitsstellenleiter des Akademienvorhabens „Alexander von Humboldt auf Reisen – Wissenschaft aus der Bewegung“ an der Berlin-Brandenburgischen Akademie der Wissenschaften.
Podiumsdiskussion: „Vernetzungen”
Gerade digitale Daten aus Editions- oder Korpusprojekten sowie deren Derivate können für die Nachnutzung in verschiedenen Szenarien interessant sein. Doch was ist nötig und möglich, um solch eine Nachnutzung zu garantieren? Wie leicht oder schwer fällt es, Daten mit bestehenden Daten zu vernetzen? Welche Publikationsoptionen bestehen? Und wie vernetzen sich Forschende eigentlich miteinander, wenn es um den Austausch von Forschungsdaten geht? Diese und weitere Fragen möchten wir in der Podiumsdiskussion „Vernetzungen” adressieren und mit Expert:innen diskutieren.
Was sollten Sie im Vorfeld organisieren?
- Übernachtungen vom 21. bis 25. September in Leipzig
- Verpflegung
- Laptop o. Ä. für die Arbeitsphasen, auf dem die erforderlichen Programme installiert sind.
(Hierzu erhalten alle angemeldeten Teilnehmende noch eine E-Mail.)
Wir begrüßen zu unserer Sommerschule alle Teilnehmenden, unabhängig von Geschlecht, sexueller Orientierung, Behinderung, physischer Erscheinung, Alter, sozialer Herkunft, Ethnie, Nationalität, Religion oder Weltanschauung. Gemeinsam wollen wir eine Atmosphäre des produktiven Lernens und Arbeitens schaffen.