W skrócie. Domenowe zbiory testowe do ewaluacji systemów automatycznego rozpoznawania mowy (ASR, ang. Automatic Speech Recognition) dla języka polskiego, budowane przez zespoły studenckie Wydziału Matematyki i Informatyki Uniwersytetu im. Adama Mickiewicza w Poznaniu (UAM). Sześć pełnych zbiorów pozostaje held-out (prywatnych, dostęp na prośbę), żeby nie trafiły do danych treningowych modeli jako gotowy zbiór testowy. Publicznie udostępniamy zbiory na wolnych licencjach, próbki ilustrujące każdą domenę oraz wyniki zespołów. Kontakt: @michaljunczyk, micjun@amu.edu.pl.
In brief. Domain-specific Polish ASR evaluation sets built by student teams at the Faculty of Mathematics and Computer Science, Adam Mickiewicz University in Poznań. Six full sets are kept held-out (private, access on request) so they do not enter model training data as a ready-made test set; openly licensed sets, a public sample per domain and the teams' results are published here. Contact: @michaljunczyk, micjun@amu.edu.pl.
Organizacja gromadzi zbiory testowe do ewaluacji systemów rozpoznawania mowy (ASR) dla języka polskiego, budowane przez zespoły studenckie w ramach przedmiotu „Warsztaty z ewaluacji systemów rozpoznawania mowy” na Wydziale Matematyki i Informatyki UAM. Prowadzący przedmiot i opiekun organizacji: Michał Junczyk (@michaljunczyk).
Zbiory obejmują wybrane domeny (m.in. medycynę, parlament, sport, kulinaria, wystąpienia publiczne) i uzupełniają publiczne benchmarki ASR dla języka polskiego o dane spoza ich zakresu tematycznego.
Trzy poziomy dostępu:
…-probka:
10 segmentów ilustrujących domenę (audio tam, gdzie pozwala licencja źródła; w przeciwnym razie
transkrypcja z odnośnikiem i znacznikiem czasu) oraz tabele wyników zespołu na pełnym zbiorze.
Dzięki temu publikowane metryki dają się interpretować bez dostępu do pełnych danych. Próbki
nie służą do ewaluacji, bo po publikacji z definicji przestają być held-out.Układ i nazewnictwo:
| Element | Konwencja | Przykład |
|---|---|---|
| Kolekcja zbiorów zespołów (poziomy 1–2) | Zbiory zespołów {rok}, jedna na edycję |
Zbiory zespołów 2026 |
| Kolekcja próbek i wyników (poziom 3) | Próbki i wyniki {rok}, jedna na edycję |
Próbki i wyniki 2026 |
| Repozytorium próbki | {rok}-{tryb}-g{NN}-{domena}-probka |
2026-zwesui-g01-tedx-probka |
| Repozytorium zbioru | {rok}-{tryb}-g{NN}-{domena} |
2026-zwesui-g01-tedx |
| Tryb studiów w nazwie | dwesui: stacjonarny, zwesui: niestacjonarny |
2026-dwesui-g01-neurologia |
| Numer zespołu | g{NN}: dwucyfrowy, numerowany w obrębie roku i trybu |
g01, g02, … |
Każda kopia w organizacji ma kartę z uznaniem autorstwa zespołu, licencją i odnośnikiem do oryginału. Kolejne edycje przedmiotu dodają nowe domeny. Celem jest wieloletni korpus ewaluacyjny, który da się filtrować.
Do końca 2026 r. planujemy włączyć zbiory organizacji do benchmarku BIGOS V3 i do Polish ASR Leaderboard V2 (zob. „Materiały powiązane”).
Granice ochrony held-out. Status prywatny chroni zbiór przed publicznym przeciekiem i przed celowym dostrajaniem modeli. Nie chroni przed dostawcą, którego system oceniano przez publiczny interfejs programistyczny (API, ang. Application Programming Interface). Dane testowe trafiają wtedy na serwery dostawcy, a to, czy nie zostaną użyte w treningu, zależy od jego polityki, nie od nas (Sculley i in., Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation, ICML 2025, §5.1). Zbiory edycji 2026 przeszły przez API komercyjnych systemów ASR, które zespoły porównywały. To znane ograniczenie. Pełną ochronę daje wyłącznie ewaluacja offline: model działa na własnej infrastrukturze, a zbiór testowy nie trafia do żadnego zasobu z dostępem do internetu.
Uwaga o właściwym użyciu. Te zbiory służą do badania systemów rozpoznawania mowy i nie są miarą zdolności studentów, którzy je zbudowali. Powstały w ramach zajęć, w warunkach kursu i pod presją terminów. Wyniki systemów ASR na danym zbiorze nie mówią nic o kompetencjach jego autorów. Prosimy nie używać ich do oceny osób ani do porównywania zespołów.
Dostęp do zbiorów held-out, współpraca badawcza, pytania: @michaljunczyk na Hugging Face lub e-mail: micjun@amu.edu.pl.
W ciągu semestru każdy zespół przechodzi pełny cykl ewaluacji ASR:
verified_by,
a próg zaliczenia wymaga, aby co najmniej 15% wierszy każdej osoby sprawdził inny członek
zespołu (weryfikacja krzyżowa); protokół normalizacji tekstu z testami jednostkowymi, stosowany
jednakowo do referencji i hipotez.Literatura obowiązkowa przedmiotu:
Materiały branżowe analizowane na zajęciach i w pracy własnej zespołów:
Literatura uzupełniająca (dopisana po edycji 2026):
Tryb stacjonarny: neurologia, kulinarna, medyczne rozmowy specjalistyczne, diagnostyka obrazowa. Tryb niestacjonarny: wystąpienia TEDx, sport, Sejm RP, botanika, rozmowy o IT/AI. Kolekcja: Zbiory zespołów 2026.
Zbiory opublikowane przez zespoły na własnych kontach (oryginały):
Zbiory sport i Sejm RP są dostępne wyłącznie w organizacji (held-out).
W czterech zbiorach (neurologia, kulinarna, sport, Sejm RP) część syntetyczna nie jest opublikowana: zespoły wygenerowały ją silnikiem, którego licencja nie pozwala na redystrybucję nagrań, i wykorzystały wyłącznie we własnej ewaluacji. Wyniki na tej części znajdują się w raportach zespołów. Opublikowane zbiory tych zespołów zawierają wyłącznie mowę naturalną.
Dla każdego z sześciu zbiorów held-out (medyczne rozmowy specjalistyczne, TEDx, sport, Sejm RP, botanika,
rozmowy o IT/AI) opublikowana jest próbka …-probka z 10 segmentami i wynikami zespołu.
Próbki zbiera kolekcja Próbki i wyniki 2026.
Dwa zbiory włączone do organizacji (kolekcja Zbiory zespołów 2025):
2025-zwesui-g02-medyczna:
200 zdań z terminologią medyczną wygenerowanych przez cztery modele językowe i zsyntetyzowanych
głosami ElevenLabs; oryginał: yanvoi/med_male_female_r2.2025-zwesui-g03-debata-prezydencka:
debata prezydencka TVP z 12 maja 2025 (13 kandydatów, 195 wypowiedzi), mowa spontaniczna;
oryginał: directtt/polish_presidential_debate.