Warsztaty z ewaluacji systemów rozpoznawania mowy (UAM WMI)

W skrócie. Domenowe zbiory testowe do ewaluacji systemów automatycznego rozpoznawania mowy (ASR, ang. Automatic Speech Recognition) dla języka polskiego, budowane przez zespoły studenckie Wydziału Matematyki i Informatyki Uniwersytetu im. Adama Mickiewicza w Poznaniu (UAM). Sześć pełnych zbiorów pozostaje held-out (prywatnych, dostęp na prośbę), żeby nie trafiły do danych treningowych modeli jako gotowy zbiór testowy. Publicznie udostępniamy zbiory na wolnych licencjach, próbki ilustrujące każdą domenę oraz wyniki zespołów. Kontakt: @michaljunczyk, micjun@amu.edu.pl.

In brief. Domain-specific Polish ASR evaluation sets built by student teams at the Faculty of Mathematics and Computer Science, Adam Mickiewicz University in Poznań. Six full sets are kept held-out (private, access on request) so they do not enter model training data as a ready-made test set; openly licensed sets, a public sample per domain and the teams' results are published here. Contact: @michaljunczyk, micjun@amu.edu.pl.

Organizacja gromadzi zbiory testowe do ewaluacji systemów rozpoznawania mowy (ASR) dla języka polskiego, budowane przez zespoły studenckie w ramach przedmiotu „Warsztaty z ewaluacji systemów rozpoznawania mowy” na Wydziale Matematyki i Informatyki UAM. Prowadzący przedmiot i opiekun organizacji: Michał Junczyk (@michaljunczyk).

Zbiory obejmują wybrane domeny (m.in. medycynę, parlament, sport, kulinaria, wystąpienia publiczne) i uzupełniają publiczne benchmarki ASR dla języka polskiego o dane spoza ich zakresu tematycznego.

Zawartość i zasady dostępu

Trzy poziomy dostępu:

  1. Zbiory zespołów: held-out (prywatne). Pełne zbiory dostarczone przez zespoły. Nie trafiają do danych treningowych modeli jako gotowe pary nagranie–transkrypcja, dzięki czemu zachowują wartość jako niezależny test (granice tej ochrony opisujemy niżej). Materiały o licencjach ograniczających redystrybucję (np. CC BY-NC-ND) wykorzystujemy wyłącznie do badań. Dostęp na prośbę.
  2. Zbiory zespołów: otwarte (publiczne). Zbiory, które zespoły opublikowały otwarcie na wolnych licencjach (CC BY 4.0). Kopie w organizacji są publiczne.
  3. Próbki i wyniki (publiczne). Dla każdego zbioru held-out osobne repozytorium …-probka: 10 segmentów ilustrujących domenę (audio tam, gdzie pozwala licencja źródła; w przeciwnym razie transkrypcja z odnośnikiem i znacznikiem czasu) oraz tabele wyników zespołu na pełnym zbiorze. Dzięki temu publikowane metryki dają się interpretować bez dostępu do pełnych danych. Próbki nie służą do ewaluacji, bo po publikacji z definicji przestają być held-out.

Układ i nazewnictwo:

Element Konwencja Przykład
Kolekcja zbiorów zespołów (poziomy 1–2) Zbiory zespołów {rok}, jedna na edycję Zbiory zespołów 2026
Kolekcja próbek i wyników (poziom 3) Próbki i wyniki {rok}, jedna na edycję Próbki i wyniki 2026
Repozytorium próbki {rok}-{tryb}-g{NN}-{domena}-probka 2026-zwesui-g01-tedx-probka
Repozytorium zbioru {rok}-{tryb}-g{NN}-{domena} 2026-zwesui-g01-tedx
Tryb studiów w nazwie dwesui: stacjonarny, zwesui: niestacjonarny 2026-dwesui-g01-neurologia
Numer zespołu g{NN}: dwucyfrowy, numerowany w obrębie roku i trybu g01, g02, …

Każda kopia w organizacji ma kartę z uznaniem autorstwa zespołu, licencją i odnośnikiem do oryginału. Kolejne edycje przedmiotu dodają nowe domeny. Celem jest wieloletni korpus ewaluacyjny, który da się filtrować.

Do końca 2026 r. planujemy włączyć zbiory organizacji do benchmarku BIGOS V3 i do Polish ASR Leaderboard V2 (zob. „Materiały powiązane”).

Granice ochrony held-out. Status prywatny chroni zbiór przed publicznym przeciekiem i przed celowym dostrajaniem modeli. Nie chroni przed dostawcą, którego system oceniano przez publiczny interfejs programistyczny (API, ang. Application Programming Interface). Dane testowe trafiają wtedy na serwery dostawcy, a to, czy nie zostaną użyte w treningu, zależy od jego polityki, nie od nas (Sculley i in., Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation, ICML 2025, §5.1). Zbiory edycji 2026 przeszły przez API komercyjnych systemów ASR, które zespoły porównywały. To znane ograniczenie. Pełną ochronę daje wyłącznie ewaluacja offline: model działa na własnej infrastrukturze, a zbiór testowy nie trafia do żadnego zasobu z dostępem do internetu.

Uwaga o właściwym użyciu. Te zbiory służą do badania systemów rozpoznawania mowy i nie są miarą zdolności studentów, którzy je zbudowali. Powstały w ramach zajęć, w warunkach kursu i pod presją terminów. Wyniki systemów ASR na danym zbiorze nie mówią nic o kompetencjach jego autorów. Prosimy nie używać ich do oceny osób ani do porównywania zespołów.

Kontakt

Dostęp do zbiorów held-out, współpraca badawcza, pytania: @michaljunczyk na Hugging Face lub e-mail: micjun@amu.edu.pl.

Metodologia

W ciągu semestru każdy zespół przechodzi pełny cykl ewaluacji ASR:

Ramy metodologiczne

Literatura obowiązkowa przedmiotu:

Materiały branżowe analizowane na zajęciach i w pracy własnej zespołów:

Literatura uzupełniająca (dopisana po edycji 2026):

Edycje

2026: 9 zespołów, 9 domen

Tryb stacjonarny: neurologia, kulinarna, medyczne rozmowy specjalistyczne, diagnostyka obrazowa. Tryb niestacjonarny: wystąpienia TEDx, sport, Sejm RP, botanika, rozmowy o IT/AI. Kolekcja: Zbiory zespołów 2026.

Zbiory opublikowane przez zespoły na własnych kontach (oryginały):

Zbiory sport i Sejm RP są dostępne wyłącznie w organizacji (held-out).

W czterech zbiorach (neurologia, kulinarna, sport, Sejm RP) część syntetyczna nie jest opublikowana: zespoły wygenerowały ją silnikiem, którego licencja nie pozwala na redystrybucję nagrań, i wykorzystały wyłącznie we własnej ewaluacji. Wyniki na tej części znajdują się w raportach zespołów. Opublikowane zbiory tych zespołów zawierają wyłącznie mowę naturalną.

Dla każdego z sześciu zbiorów held-out (medyczne rozmowy specjalistyczne, TEDx, sport, Sejm RP, botanika, rozmowy o IT/AI) opublikowana jest próbka …-probka z 10 segmentami i wynikami zespołu. Próbki zbiera kolekcja Próbki i wyniki 2026.

2025: 3 zespoły

Dwa zbiory włączone do organizacji (kolekcja Zbiory zespołów 2025):

Sylabusy

Materiały powiązane