Zentrales Register sorbischer Sprachressourcen
Zentrales Register sorbischer Sprachressourcen
Dieses Register bietet eine institutionsübergreifende Übersicht über veröffentlichte Sprachdaten für die ober- und niedersorbische Sprache.
Die Ressourcen selbst werden weiterhin dezentral durch die jeweils verantwortlichen Institutionen, Projekte oder Forschungseinrichtungen veröffentlicht. Das Register weist nach, welche Ressourcen vorhanden sind, wo sie liegen, wie sie zugänglich sind und welche Lizenz angegeben ist.
Letzte Änderung dieser Wiki-Seite: 29.07.2026
Schnellzugriff: Sprachdaten · Modelle und Dienste · Neue Ressource ergänzen · Datenfelder erläutert
Zweck des Registers
Das Register unterstützt die Umsetzung des Beschlusses Nr. 761 der Stiftung für das sorbische Volk.[1]
Auf Grundlage relevanter Nutzungsszenarien für digitale Sprachtechnologien soll untersucht werden, welche quantitativen, qualitativen, inhaltlichen und nutzungsrechtlichen Bedarfe an Sprachdaten bestehen. Das Register dokumentiert hierfür den bereits bekannten und veröffentlichten Bestand.
Was enthält das Register?
| Enthalten | Nicht enthalten | Grundprinzip |
|---|---|---|
|
|
Dezentrale Veröffentlichung – zentraler Nachweis Die Daten verbleiben auf Hugging Face, GitHub, institutionellen Repositorien oder anderen geeigneten Plattformen. Im Wiki wird nur der zentrale, einheitliche Nachweis geführt. |
Hinweise zur Nutzung
Hinweise zur Nutzung der Tabellen anzeigen
Die Tabellen können durch Anklicken der Spaltenüberschriften sortiert werden.
Verwendete Kennzeichnungen:
- ✓ frei – ohne Anmeldung öffentlich abrufbar
- ◐ Registrierung – Zugang nach Anmeldung oder Freischaltung
- ✉ auf Anfrage – Zugang nur nach Kontaktaufnahme
- ⓘ nur Metadaten – Beschreibung vorhanden, Daten selbst nicht öffentlich
- ⚠ Prüfbedarf – Angaben sind unvollständig oder sollten überprüft werden
Die Spalte „Zugang“ beschreibt nur die technische Erreichbarkeit. Sie sagt nicht aus, dass jede Form der Nutzung rechtlich erlaubt ist.
Hinweis: Neue Ressource ergänzen
Anleitung zum Eintragen oder Aktualisieren einer Ressource
- Oben rechts ein Benutzerkonto anlegen und anmelden.
- Falls keine Schaltfläche „Bearbeiten“ oder „Quelltext bearbeiten“ angezeigt wird, die zuständige Wiki-Administration um Bearbeitungsrechte bitten.
- Vor dem Eintragen prüfen, ob die Ressource bereits in der Tabelle vorhanden ist.
- Die maßgebliche Veröffentlichungsseite öffnen und mindestens Titel, Sprache, Institution, Zugang, Lizenz und Umfang prüfen.
- Im Wiki „Quelltext bearbeiten“ wählen.
- In der Tabelle eine bestehende Zeile vom Zeichen
|-bis unmittelbar vor der nächsten Zeile kopieren. - Die kopierte Zeile vor dem Kommentar „NEUE EINTRÄGE OBERHALB DIESER ZEILE EINFÜGEN“ einfügen.
- Sämtliche Beispielwerte ersetzen.
- „Vorschau zeigen“ wählen und insbesondere Links, Tabellenstruktur und Zeilenumbrüche prüfen.
- Eine kurze Bearbeitungszusammenfassung eingeben, zum Beispiel „Neue Sprachressource ergänzt“.
- Seite speichern.
- Falls das Wiki bestätigte Versionen verwendet, kann anschließend noch eine redaktionelle Freigabe notwendig sein.
Eine Ressource erhält eine eigene Zeile, wenn sich mindestens eines dieser Merkmale wesentlich unterscheidet:
- Lizenz,
- Zugang,
- Sprache,
- Ressourcentyp,
- verantwortliche Institution,
- Veröffentlichungsort.
Ein Repositorium mit mehreren unterschiedlich lizenzierten Datensätzen darf deshalb nicht pauschal als eine einzige Ressource eingetragen werden.
Hinweis: Bedeutung der Datenfelder
Welche Angaben gehören in welche Spalte?
| Feld | Einzutragende Information | Zulässige beziehungsweise empfohlene Werte |
|---|---|---|
| Ressource | Öffentlicher Titel mit direktem Link und einer Beschreibung in höchstens ein bis zwei Sätzen. | Der Link soll möglichst direkt zur Dataset Card, README-Datei, Detailseite oder Downloadseite führen. |
| Sprache(n) | Sprache oder Sprachkombination der Ressource. |
|
| Typ / Modalität | Inhaltliche und technische Grundart der Ressource. |
|
| Verantwortliche Institution | Institution oder Projekt, das die Ressource veröffentlicht beziehungsweise fachlich verantwortet. | Nicht pauschal „Eigentümer“ eintragen, da veröffentlichende Stelle und Rechteinhaber voneinander abweichen können. |
| Zugang | Technische Verfügbarkeit der Ressource. |
|
| Lizenz | Exakte Lizenzbezeichnung einschließlich Version. |
Beispiele:
|
| Umfang | Aussagekräftigste verfügbare Mengeneinheit. |
Je nach Ressource beispielsweise:
Falls kein Umfang dokumentiert ist, „nicht dokumentiert“ eintragen. |
| Stand / Prüfhinweis | Version oder Veröffentlichungsstand, Datum der letzten Registerprüfung sowie bekannte Einschränkungen. |
Beispiel:
Zusätzlich gegebenenfalls:
|
Hinweis: Vorlage für eine neue Tabellenzeile
Vorlage anzeigen und kopieren
|- | [https://beispiel.de Titel der Ressource]<br> <small>Kurzbeschreibung in höchstens ein bis zwei Sätzen.</small> | hsb | Textkorpus | Name der verantwortlichen Institution | <span style="white-space:nowrap;">✓ frei</span> | CC BY 4.0 | Anzahl der Texte, Sätze, Stunden oder Dateien | Quelle geprüft: TT.MM.JJJJ<br> <small>Gegebenenfalls Hinweise zu Qualität, Dokumentation oder Rechten.</small>
Sprachdaten
Die folgende Tabelle enthält den derzeit bekannten und anhand öffentlich zugänglicher Quellen überprüften Startbestand. Sie ist noch keine vollständige Inventur aller sorbischen Sprachressourcen.
| Ressource | Sprache(n) | Typ / Modalität | Verantwortliche Institution | Zugang | Lizenz | Umfang | Stand / Prüfhinweis |
|---|---|---|---|---|---|---|---|
Text Collection UnfilteredUngefilterte Sammlung von Texten und Dokumenten der Stiftung für das sorbische Volk in unterschiedlichen Sprachkombinationen. |
hsb, dsb, de | Dokumenten- und Textsammlung | Stiftung für das sorbische Volk | ✓ frei | CC BY 4.0 | 28 Dokumente 45,2 MB |
Quelle geprüft: 29.07.2026Office- und PDF-Dokumente; Dubletten möglich; Sprache der einzelnen Dokumente muss teilweise manuell geprüft werden. |
nowosce_webstronaSammlung obersorbischer Nachrichten- und Webseitentexte des WITAJ-Sprachzentrums. |
hsb | Webtext- / Nachrichtenkorpus | WITAJ-Sprachzentrum / Domowina e. V. | ✓ frei | CC BY 4.0 | 174 Texte 28,5 kB |
Quelle geprüft: 29.07.2026Dataset Card enthält nur eine knappe Beschreibung. |
Teksty k temje rěč a pedagogikaObersorbische Texte und Dokumente zum Themenbereich Sprache und Pädagogik. |
hsb | Text- / Dokumentensammlung | WITAJ-Sprachzentrum / Domowina e. V. | ✓ frei | CC BY 4.0 | 1,16 MBAnzahl der Dokumente nicht ausgewiesen |
Quelle geprüft: 29.07.2026README-Datei ist leer; Inhalt, Dateiformate und Entstehung sollten noch genauer dokumentiert werden. |
jurij_brezanObersorbisches literarisches Textkorpus mit Texten von Jurij Brězan. |
hsb | Literatur- / Textkorpus | WITAJ-Sprachzentrum / Domowina e. V. | ✓ frei | CC BY 4.0laut Plattform |
8.013 Textabschnitte 787 kB |
Quelle geprüft: 29.07.2026⚠ Rechtekette und Grundlage der Lizenzkennzeichnung vor produktiver Nachnutzung gesondert prüfen. |
llms-limited-resources2025Auf Hugging Face bereitgestellte Kopie beziehungsweise Zusammenstellung von Ressourcen des WMT-Shared-Tasks 2025. |
de, hsblaut Plattform |
Trainings- und Evaluationsdaten | WITAJ-Sprachzentrum / TUM-NLP | ✓ frei | CC BY 4.0laut Plattform |
196 MB | Quelle geprüft: 29.07.2026Beziehung zum ursprünglichen GitHub-Repositorium, enthaltene Teilmengen und mögliche Dubletten noch genauer dokumentieren. |
WMT 2026 – monolinguale sorbische KorporaGefilterte und zusammengeführte monolinguale Sätze aus unterschiedlichen Quellen. |
hsb, dsb | Monolinguales Textkorpus | TUM-NLPunter Mitwirkung des WITAJ-Sprachzentrums |
✓ frei | Apache-2.0 | 512.671 hsb-Sätze 38.028 dsb-Sätze |
Ausgabe 2026Quelle geprüft: 29.07.2026 |
WMT 2026 – parallele TrainingskorporaParallele Satzpaare für maschinelle Übersetzung zwischen Deutsch, Ober- und Niedersorbisch. |
de–hsb de–dsb hsb–dsb |
Parallelkorpus / Übersetzungsdaten | TUM-NLPunter Mitwirkung des WITAJ-Sprachzentrums |
✓ frei | CC BY-NC-SAVersion nicht ausgewiesen; Nutzungsbedingungen prüfen |
de–hsb: 23.116 Satzpaarede–dsb: 30.560 Satzpaare |
Ausgabe 2026Quelle geprüft: 29.07.2026 |
WMT 2026 – MT-EntwicklungsdatensätzeEntwicklungs- und Evaluationsdaten für maschinelle Übersetzung. |
de–hsb de–dsb hsb–dsb |
Evaluationsdaten / Parallelkorpus | TUM-NLPunter Mitwirkung des WITAJ-Sprachzentrums |
✓ frei | CC BY-NC-SAVersion nicht ausgewiesen |
jeweils 4.000 Satzpaareinsgesamt 12.000 |
Ausgabe 2026Quelle geprüft: 29.07.2026 |
WMT 2026 – Question AnsweringFrage-Antwort-Daten aus realen Sprachzertifizierungsaufgaben mit Kontext, Antwortmöglichkeiten und korrekter Lösung. |
hsb, dsb | Frage-Antwort- / Evaluationsdaten | TUM-NLPunter Mitwirkung des WITAJ-Sprachzentrums |
✓ frei | CC BY-NC-SAVersion nicht ausgewiesen |
158 Instanzen laut READMEVerteilung auf die Sprachen nicht eindeutig ausgewiesen |
Ausgabe 2026Quelle geprüft: 29.07.2026 |
WMT 2026 – RechtschreibprüfungSätze mit höchstens einem Rechtschreibfehler sowie Referenz, Fehlerwort und Korrektur. |
hsb, dsb | Rechtschreib- / Evaluationsdaten | TUM-NLPunter Mitwirkung des WITAJ-Sprachzentrums |
✓ frei | CC BY-NC-SAVersion nicht ausgewiesen |
2.000 Instanzen laut READMEVerteilung auf die Sprachen nicht eindeutig ausgewiesen |
Ausgabe 2026Quelle geprüft: 29.07.2026 |
WMT 2026 – GrammatikprüfungSätze mit höchstens einem grammatischen Fehler sowie Referenz, Fehlerwort und Korrektur. |
hsb, dsb | Grammatik- / Evaluationsdaten | TUM-NLPunter Mitwirkung des WITAJ-Sprachzentrums |
✓ frei | CC BY-NC-SAVersion nicht ausgewiesen |
2.000 hsb-Instanzen1.250 dsb-Instanzen |
Ausgabe 2026Quelle geprüft: 29.07.2026 |
WMT 2026 – mathematisches SchlussfolgernMathematische Aufgaben niedriger und mittlerer Schwierigkeit mit Lösungen. |
hsb, dsb | Frage-Antwort- / Evaluationsdaten | TUM-NLPunter Mitwirkung des WITAJ-Sprachzentrums |
✓ frei | Apache-2.0 | je Sprachfassung 24 Aufgaben12 leicht, 12 mittel |
Ausgabe 2026Quelle geprüft: 29.07.2026 |
Modelle, Anwendungen und Dienste
Modelle, Anwendungen und Dienste werden getrennt von den eigentlichen Sprachdaten geführt. Ein Modell ist nicht dasselbe wie der Datensatz, mit dem es trainiert oder geprüft wurde.
| Ressource | Sprache(n) | Art | Verantwortliche Stelle | Zugang | Lizenz / Bedingungen | Stand / Hinweis |
|---|---|---|---|---|---|---|
Qwen2.5-3B-Instruct-hsb-dsbAuf Ober- und Niedersorbisch angepasstes Sprachmodell für Textgenerierung, Übersetzung und Frage-Antwort-Aufgaben. |
hsb, dsb | Large Language Modelgroßes Sprachmodell |
TartuNLP | ✓ frei abrufbar | Qwen Research License | 3 Milliarden ParameterQuelle geprüft: 29.07.2026 |
Sotra / serbski.chatWebbasierter Übersetzungsdienst zwischen Deutsch, Ober- und Niedersorbisch mit integrierter Rechtschreibprüfung. |
hsb, dsb, de | Übersetzungsdienst | WITAJ-Sprachzentrum / Domowina e. V. | ✓ öffentlich nutzbar | Keine offene Lizenz für Dienst oder zugrunde liegendes Gesamtkorpus ausgewiesen | Quelle geprüft: 29.07.2026Der zugrunde liegende Parallelkorpus wird fortlaufend erweitert, ist über den Webdienst jedoch nicht als vollständiger Datensatz öffentlich herunterladbar. |
Pflege und Verantwortung
Empfohlenes Pflegemodell:
- Die veröffentlichende Institution prüft Rechte und Lizenz vor der Veröffentlichung.
- Die Institution meldet neue oder aktualisierte Ressourcen an die zentrale Redaktion.
- Die zentrale Redaktion prüft die Mindestmetadaten und ergänzt den Registereintrag.
- Jeder Eintrag wird mindestens einmal jährlich bestätigt oder aktualisiert.
- Änderungen an Lizenz, Zugang oder Veröffentlichungsort werden zeitnah nachgeführt.
- Nicht mehr verfügbare Ressourcen werden nicht gelöscht, sondern entsprechend gekennzeichnet.
Zentrale redaktionelle Verantwortung: Stiftung für das sorbische Volk / Digitalisierungsbeauftragter, in Zusammenarbeit mit den veröffentlichenden Institutionen.
Siehe auch
- 10. Open Access, Open Data, Lizenzen
- 12.4 KI, digitale Sprachtechnologien und offene Sprachdaten
- 13.2.1 Zukünftige Maßnahmen und Schritte
- 2.2_3 – Zentrales Register sorbischer Sprachressourcen erstellen und fortlaufend pflegen
Kategorie:Sorbische Sprachressourcen Kategorie:Digitale Sprachtechnologien Kategorie:Open Data
- ↑ Vgl. Stiftung für das sorbische Volk 2026: Beschlussprotokoll der 92. Sitzung des Stiftungsrates vom 19.05.2026, Beschluss Nr. 761, S. 3. URL: https://zalozba.de/fileadmin/user_upload/Dokumente/Beschlussprotokolle/2026-05-19_Beschlussprotokoll_751-765.pdf, abgerufen am 27.07.2026.