Zentrales Register sorbischer Sprachressourcen

z Digitalizaciski koncept
Wersija wot 29. julija 2026, 16:06 wužiwarja Měrko Šenk (diskusija | přinoški) (Wutwori stronu z '__TOC__ <div style="border-left:6px solid #3366cc; background:#f8f9fa; padding:1em 1.2em; margin:0 0 1.2em 0;"> <div style="font-size:125%; font-weight:bold; margin-bottom:0.4…')

Zur Navigation springen Zur Suche springen

Zentrales Register sorbischer Sprachressourcen

Dieses Register bietet eine institutionsübergreifende Übersicht über veröffentlichte Sprachdaten für die ober- und niedersorbische Sprache.

Die Ressourcen selbst werden weiterhin dezentral durch die jeweils verantwortlichen Institutionen, Projekte oder Forschungseinrichtungen veröffentlicht. Das Register weist nach, welche Ressourcen vorhanden sind, wo sie liegen, wie sie zugänglich sind und welche Lizenz angegeben ist.

Letzte Änderung dieser Wiki-Seite: 29.07.2026

Schnellzugriff: Sprachdaten · Modelle und Dienste · Neue Ressource ergänzen · Datenfelder erläutert

Zweck und strategischer Zusammenhang

Das Register unterstützt die Umsetzung des Beschlusses Nr. 761 der Stiftung für das sorbische Volk.[1]

Auf Grundlage relevanter Nutzungsszenarien für digitale Sprachtechnologien soll untersucht werden, welche quantitativen, qualitativen, inhaltlichen und nutzungsrechtlichen Bedarfe an Sprachdaten bestehen. Das Register dokumentiert hierfür den bereits bekannten und veröffentlichten Bestand.

Was enthält das Register?

Enthalten Nicht enthalten Grundprinzip
  • veröffentlichte Textkorpora
  • Parallel- und Übersetzungsdaten
  • Wörterbücher, Wortlisten und Terminologien
  • Audio- und Transkriptionsdaten
  • Video- und Transkriptionsdaten
  • Frage-Antwort-Daten
  • Test- und Evaluationsdaten
  • Daten für Rechtschreib- und Grammatikprüfung
  • interne Speicherorte
  • personenbezogene oder vertrauliche Angaben
  • rechtlich nicht freigegebene Dateien
  • vollständige technische Detaildokumentationen
  • eine eigenständige rechtliche Freigabe

Dezentrale Veröffentlichung – zentraler Nachweis

Die Daten verbleiben auf Hugging Face, GitHub, institutionellen Repositorien oder anderen geeigneten Plattformen. Im Wiki wird nur der zentrale, einheitliche Nachweis geführt.

Hinweise zur Nutzung der Tabellen

Hinweise anzeigen

Die Tabellen können durch Anklicken der Spaltenüberschriften sortiert werden.

Verwendete Kennzeichnungen:

  • ✓ frei – ohne Anmeldung öffentlich abrufbar
  • ◐ Registrierung – Zugang nach Anmeldung oder Freischaltung
  • ✉ auf Anfrage – Zugang nur nach Kontaktaufnahme
  • ⓘ nur Metadaten – Beschreibung vorhanden, Daten selbst nicht öffentlich
  • ⚠ Prüfbedarf – Angaben sind unvollständig oder sollten überprüft werden

Die Spalte „Zugang“ beschreibt nur die technische Erreichbarkeit. Sie sagt nicht aus, dass jede Form der Nutzung rechtlich erlaubt ist.

Hinweis: Neue Ressource ergänzen

Anleitung zum Eintragen oder Aktualisieren einer Ressource

  1. Oben rechts ein Benutzerkonto anlegen und anmelden.
  2. Falls keine Schaltfläche „Bearbeiten“ oder „Quelltext bearbeiten“ angezeigt wird, die zuständige Wiki-Administration um Bearbeitungsrechte bitten.
  3. Vor dem Eintragen prüfen, ob die Ressource bereits in der Tabelle vorhanden ist.
  4. Die maßgebliche Veröffentlichungsseite öffnen und mindestens Titel, Sprache, Institution, Zugang, Lizenz und Umfang prüfen.
  5. Im Wiki „Quelltext bearbeiten“ wählen.
  6. In der Tabelle eine bestehende Zeile vom Zeichen |- bis unmittelbar vor der nächsten Zeile kopieren.
  7. Die kopierte Zeile vor dem Kommentar „NEUE EINTRÄGE OBERHALB DIESER ZEILE EINFÜGEN“ einfügen.
  8. Sämtliche Beispielwerte ersetzen.
  9. „Vorschau zeigen“ wählen und insbesondere Links, Tabellenstruktur und Zeilenumbrüche prüfen.
  10. Eine kurze Bearbeitungszusammenfassung eingeben, zum Beispiel „Neue Sprachressource ergänzt“.
  11. Seite speichern.
  12. Falls das Wiki bestätigte Versionen verwendet, kann anschließend noch eine redaktionelle Freigabe notwendig sein.

Eine Ressource erhält eine eigene Zeile, wenn sich mindestens eines dieser Merkmale wesentlich unterscheidet:

  • Lizenz,
  • Zugang,
  • Sprache,
  • Ressourcentyp,
  • verantwortliche Institution,
  • Veröffentlichungsort.

Ein Repositorium mit mehreren unterschiedlich lizenzierten Datensätzen darf deshalb nicht pauschal als eine einzige Ressource eingetragen werden.

Hinweis: Bedeutung der Datenfelder

Welche Angaben gehören in welche Spalte?

Feld Einzutragende Information Zulässige beziehungsweise empfohlene Werte
Ressource Öffentlicher Titel mit direktem Link und einer Beschreibung in höchstens ein bis zwei Sätzen. Der Link soll möglichst direkt zur Dataset Card, README-Datei, Detailseite oder Downloadseite führen.
Sprache(n) Sprache oder Sprachkombination der Ressource.
  • hsb – Obersorbisch
  • dsb – Niedersorbisch
  • de – Deutsch
  • weitere Sprachcodes bei mehrsprachigen Ressourcen
Typ / Modalität Inhaltliche und technische Grundart der Ressource.
  • Textkorpus
  • Parallelkorpus
  • Dokumentensammlung
  • Wörterbuch / Lexikon
  • Terminologie / Wortliste
  • Audiodaten
  • Audio mit Transkription
  • Frage-Antwort-Daten
  • Rechtschreibdaten
  • Grammatikdaten
  • Evaluations-/Testdaten
  • OCR-Daten
Verantwortliche Institution Institution oder Projekt, das die Ressource veröffentlicht beziehungsweise fachlich verantwortet. Nicht pauschal „Eigentümer“ eintragen, da veröffentlichende Stelle und Rechteinhaber voneinander abweichen können.
Zugang Technische Verfügbarkeit der Ressource.
  • ✓ frei
  • ◐ Registrierung
  • ✉ auf Anfrage
  • ⓘ nur Metadaten
  • nicht mehr verfügbar
  • unklar
Lizenz Exakte Lizenzbezeichnung einschließlich Version.

Beispiele:

  • CC0 1.0
  • CC BY 4.0
  • Apache-2.0
  • CC BY-NC-SA, Version nicht ausgewiesen
  • keine Lizenz ausgewiesen
  • Lizenz noch zu prüfen
Umfang Aussagekräftigste verfügbare Mengeneinheit.

Je nach Ressource beispielsweise:

  • Dokumente
  • Texte
  • Sätze oder Satzpaare
  • Wörter
  • Tokens
  • Einträge
  • Stunden Audio
  • Sprecherinnen und Sprecher
  • Dateien und Dateigröße

Falls kein Umfang dokumentiert ist, „nicht dokumentiert“ eintragen.

Stand / Prüfhinweis Version oder Veröffentlichungsstand, Datum der letzten Registerprüfung sowie bekannte Einschränkungen.

Beispiel:

Quelle geprüft: 29.07.2026

Zusätzlich gegebenenfalls:

  • ungefilterte Daten
  • Dubletten möglich
  • Sprachzuordnung zu prüfen
  • README unvollständig
  • Rechtekette zu prüfen

Hinweis: Vorlage für eine neue Tabellenzeile

Vorlage anzeigen und kopieren

|-
| [https://beispiel.de Titel der Ressource]<br>
  <small>Kurzbeschreibung in höchstens ein bis zwei Sätzen.</small>
| hsb
| Textkorpus
| Name der verantwortlichen Institution
| <span style="white-space:nowrap;">✓ frei</span>
| CC BY 4.0
| Anzahl der Texte, Sätze, Stunden oder Dateien
| Quelle geprüft: TT.MM.JJJJ<br>
  <small>Gegebenenfalls Hinweise zu Qualität, Dokumentation oder Rechten.</small>

Sprachdaten

Die folgende Tabelle enthält den derzeit bekannten und anhand öffentlich zugänglicher Quellen überprüften Startbestand. Sie ist noch keine vollständige Inventur aller sorbischen Sprachressourcen.

Ressource Sprache(n) Typ / Modalität Verantwortliche Institution Zugang Lizenz Umfang Stand / Prüfhinweis
Text Collection Unfiltered
 Ungefilterte Sammlung von Texten und Dokumenten der Stiftung für das sorbische Volk in unterschiedlichen Sprachkombinationen.
hsb, dsb, de Dokumenten- und Textsammlung Stiftung für das sorbische Volk ✓ frei CC BY 4.0 28 Dokumente
45,2 MB
Quelle geprüft: 29.07.2026
 Office- und PDF-Dokumente; Dubletten möglich; Sprache der einzelnen Dokumente muss teilweise manuell geprüft werden.
nowosce_webstrona
 Sammlung obersorbischer Nachrichten- und Webseitentexte des WITAJ-Sprachzentrums.
hsb Webtext- / Nachrichtenkorpus WITAJ-Sprachzentrum / Domowina e. V. ✓ frei CC BY 4.0 174 Texte
28,5 kB
Quelle geprüft: 29.07.2026
 Dataset Card enthält nur eine knappe Beschreibung.
Teksty k temje rěč a pedagogika
 Obersorbische Texte und Dokumente zum Themenbereich Sprache und Pädagogik.
hsb Text- / Dokumentensammlung WITAJ-Sprachzentrum / Domowina e. V. ✓ frei CC BY 4.0 1,16 MB
 Anzahl der Dokumente nicht ausgewiesen
Quelle geprüft: 29.07.2026
 README-Datei ist leer; Inhalt, Dateiformate und Entstehung sollten noch genauer dokumentiert werden.
jurij_brezan
 Obersorbisches literarisches Textkorpus mit Texten von Jurij Brězan.
hsb Literatur- / Textkorpus WITAJ-Sprachzentrum / Domowina e. V. ✓ frei CC BY 4.0
 laut Plattform
8.013 Textabschnitte
787 kB
Quelle geprüft: 29.07.2026
 ⚠ Rechtekette und Grundlage der Lizenzkennzeichnung vor produktiver Nachnutzung gesondert prüfen.
llms-limited-resources2025
 Auf Hugging Face bereitgestellte Kopie beziehungsweise Zusammenstellung von Ressourcen des WMT-Shared-Tasks 2025.
de, hsb
 laut Plattform
Trainings- und Evaluationsdaten WITAJ-Sprachzentrum / TUM-NLP ✓ frei CC BY 4.0
 laut Plattform
196 MB Quelle geprüft: 29.07.2026
 Beziehung zum ursprünglichen GitHub-Repositorium, enthaltene Teilmengen und mögliche Dubletten noch genauer dokumentieren.
WMT 2026 – monolinguale sorbische Korpora
 Gefilterte und zusammengeführte monolinguale Sätze aus unterschiedlichen Quellen.
hsb, dsb Monolinguales Textkorpus TUM-NLP
 unter Mitwirkung des WITAJ-Sprachzentrums
✓ frei Apache-2.0 512.671 hsb-Sätze
38.028 dsb-Sätze
Ausgabe 2026
 Quelle geprüft: 29.07.2026
Quellenkennzeichnung ist über das Feld id enthalten.
WMT 2026 – parallele Trainingskorpora
 Parallele Satzpaare für maschinelle Übersetzung zwischen Deutsch, Ober- und Niedersorbisch.
de–hsb
de–dsb
hsb–dsb
Parallelkorpus / Übersetzungsdaten TUM-NLP
 unter Mitwirkung des WITAJ-Sprachzentrums
✓ frei CC BY-NC-SA
 Version nicht ausgewiesen; Nutzungsbedingungen prüfen
de–hsb: 23.116 Satzpaare
 de–dsb: 30.560 Satzpaare
hsb–dsb: 67.845 Satzpaare
Ausgabe 2026
 Quelle geprüft: 29.07.2026
Insgesamt 121.521 Satzpaare; NC- und SA-Bedingungen bei geplanter Nachnutzung beachten.
WMT 2026 – MT-Entwicklungsdatensätze
 Entwicklungs- und Evaluationsdaten für maschinelle Übersetzung.
de–hsb
de–dsb
hsb–dsb
Evaluationsdaten / Parallelkorpus TUM-NLP
 unter Mitwirkung des WITAJ-Sprachzentrums
✓ frei CC BY-NC-SA
 Version nicht ausgewiesen
jeweils 4.000 Satzpaare
 insgesamt 12.000
Ausgabe 2026
 Quelle geprüft: 29.07.2026
WMT 2026 – Question Answering
 Frage-Antwort-Daten aus realen Sprachzertifizierungsaufgaben mit Kontext, Antwortmöglichkeiten und korrekter Lösung.
hsb, dsb Frage-Antwort- / Evaluationsdaten TUM-NLP
 unter Mitwirkung des WITAJ-Sprachzentrums
✓ frei CC BY-NC-SA
 Version nicht ausgewiesen
158 Instanzen laut README
 Verteilung auf die Sprachen nicht eindeutig ausgewiesen
Ausgabe 2026
 Quelle geprüft: 29.07.2026
WMT 2026 – Rechtschreibprüfung
 Sätze mit höchstens einem Rechtschreibfehler sowie Referenz, Fehlerwort und Korrektur.
hsb, dsb Rechtschreib- / Evaluationsdaten TUM-NLP
 unter Mitwirkung des WITAJ-Sprachzentrums
✓ frei CC BY-NC-SA
 Version nicht ausgewiesen
2.000 Instanzen laut README
 Verteilung auf die Sprachen nicht eindeutig ausgewiesen
Ausgabe 2026
 Quelle geprüft: 29.07.2026
WMT 2026 – Grammatikprüfung
 Sätze mit höchstens einem grammatischen Fehler sowie Referenz, Fehlerwort und Korrektur.
hsb, dsb Grammatik- / Evaluationsdaten TUM-NLP
 unter Mitwirkung des WITAJ-Sprachzentrums
✓ frei CC BY-NC-SA
 Version nicht ausgewiesen
2.000 hsb-Instanzen
 1.250 dsb-Instanzen
Ausgabe 2026
 Quelle geprüft: 29.07.2026
WMT 2026 – mathematisches Schlussfolgern
 Mathematische Aufgaben niedriger und mittlerer Schwierigkeit mit Lösungen.
hsb, dsb Frage-Antwort- / Evaluationsdaten TUM-NLP
 unter Mitwirkung des WITAJ-Sprachzentrums
✓ frei Apache-2.0 je Sprachfassung 24 Aufgaben
 12 leicht, 12 mittel
Ausgabe 2026
 Quelle geprüft: 29.07.2026


Modelle, Anwendungen und Dienste

Modelle, Anwendungen und Dienste werden getrennt von den eigentlichen Sprachdaten geführt. Ein Modell ist nicht dasselbe wie der Datensatz, mit dem es trainiert oder geprüft wurde.

Ressource Sprache(n) Art Verantwortliche Stelle Zugang Lizenz / Bedingungen Stand / Hinweis
Qwen2.5-3B-Instruct-hsb-dsb
 Auf Ober- und Niedersorbisch angepasstes Sprachmodell für Textgenerierung, Übersetzung und Frage-Antwort-Aufgaben.
hsb, dsb Large Language Model
 großes Sprachmodell
TartuNLP ✓ frei abrufbar Qwen Research License 3 Milliarden Parameter
 Quelle geprüft: 29.07.2026
Forschungsmodell; laut Model Card nicht umfassend für den allgemeinen produktiven Einsatz getestet.
Sotra / serbski.chat
 Webbasierter Übersetzungsdienst zwischen Deutsch, Ober- und Niedersorbisch mit integrierter Rechtschreibprüfung.
hsb, dsb, de Übersetzungsdienst WITAJ-Sprachzentrum / Domowina e. V. ✓ öffentlich nutzbar Keine offene Lizenz für Dienst oder zugrunde liegendes Gesamtkorpus ausgewiesen Quelle geprüft: 29.07.2026
 Der zugrunde liegende Parallelkorpus wird fortlaufend erweitert, ist über den Webdienst jedoch nicht als vollständiger Datensatz öffentlich herunterladbar.

Pflege und Verantwortung

Empfohlenes Pflegemodell:

  • Die veröffentlichende Institution prüft Rechte und Lizenz vor der Veröffentlichung.
  • Die Institution meldet neue oder aktualisierte Ressourcen an die zentrale Redaktion.
  • Die zentrale Redaktion prüft die Mindestmetadaten und ergänzt den Registereintrag.
  • Jeder Eintrag wird mindestens einmal jährlich bestätigt oder aktualisiert.
  • Änderungen an Lizenz, Zugang oder Veröffentlichungsort werden zeitnah nachgeführt.
  • Nicht mehr verfügbare Ressourcen werden nicht gelöscht, sondern entsprechend gekennzeichnet.

Zentrale redaktionelle Verantwortung: Stiftung für das sorbische Volk / Digitalisierungsbeauftragter, in Zusammenarbeit mit den veröffentlichenden Institutionen.

Siehe auch

Kategorie:Sorbische Sprachressourcen Kategorie:Digitale Sprachtechnologien Kategorie:Open Data

  1. Vgl. Stiftung für das sorbische Volk 2026: Beschlussprotokoll der 92. Sitzung des Stiftungsrates vom 19.05.2026, Beschluss Nr. 761, S. 3. URL: https://zalozba.de/fileadmin/user_upload/Dokumente/Beschlussprotokolle/2026-05-19_Beschlussprotokoll_751-765.pdf, abgerufen am 27.07.2026.