Models de transcripció
La nostra recomanació la trobareu en aquesta pàgina.
Avaluacions dels models que hem provat
| Model | Paràmetres (B) | Memòria (GB) | WER combinat | WER Fleurs | CER Fleurs | WER OpenSLR | CER OpenSLR | RTF |
|---|---|---|---|---|---|---|---|---|
| (*) gpt-4o-transcribe | 0.0352 | 0.0284 | 0.0134 | 0.0419 | 0.0193 | |||
| (*) gemini-3.8-flash | 0.0457 | 0.0343 | 0.0192 | 0.0571 | 0.0355 | |||
| (*) gemini-3.1-pro-preview | 0.0563 | 0.0456 | 0.0270 | 0.0670 | 0.0422 | |||
| projecte-aina/whisper-large-v3-ca-3catparla | 1.6 | 3.1 | 0.0593 | 0.0619 | 0.0339 | 0.0567 | 0.0190 | 0.3651 |
| whisper-large-v3-turbo | 0.8 | 1.6 | 0.0629 | 0.0505 | 0.0173 | 0.0752 | 0.0285 | 0.0543 |
| whisper-large-v3 | 1.6 | 3.1 | 0.0670 | 0.0482 | 0.0171 | 0.0858 | 0.0360 | 0.2297 |
| whisper-medium | 0.8 | 1.5 | 0.0906 | 0.0740 | 0.0244 | 0.1072 | 0.0425 | 0.1531 |
| omniASR_CTC_3B | 3.0 | 6.0 | 0.1089 | 0.0944 | 0.0280 | 0.1234 | 0.0357 | 0.1444 |
| omniASR_LLM_300M | 1.6 | 3.3 | 0.1162 | 0.1068 | 0.0353 | 0.1256 | 0.0388 | 0.3173 |
| omniASR_CTC_1B | 1.0 | 2.0 | 0.1309 | 0.1116 | 0.0341 | 0.1502 | 0.0419 | 0.0517 |
| whisper-small | 0.2 | 0.5 | 0.1467 | 0.1255 | 0.0403 | 0.1679 | 0.0626 | 0.0740 |
| omniASR_CTC_300M | 0.3 | 0.6 | 0.2249 | 0.2011 | 0.0537 | 0.2488 | 0.0665 | 0.0206 |
| whisper-base | 0.1 | 0.1 | 0.2793 | 0.2501 | 0.0823 | 0.3085 | 0.1214 | 0.0435 |
| gemma-4-E2B | 2.3 | 4.6 | 0.3761 | 0.2711 | 0.2088 | 0.4811 | 0.4569 | 0.3471 |
| whisper-tiny | 0.0 | 0.1 | 0.3982 | 0.3806 | 0.1385 | 0.4157 | 0.1835 | 0.0325 |
| gemma-4-E4B | 4.5 | 9 | 0.3986 | 0.2304 | 0.1964 | 0.5669 | 0.5164 | 3.5222 |
WER Fleurs
10% habilitat d'un humà
10% habilitat d'un humà
(*) gpt-4o-transcribe
0.0284
(*) gemini-3.8-flash
0.0343
(*) gemini-3.1-pro-preview
0.0456
projecte-aina/whisper-large-v3-ca-3catparla
0.0619
whisper-large-v3-turbo
0.0505
whisper-large-v3
0.0482
whisper-medium
0.0740
omniASR_CTC_3B
0.0944
omniASR_LLM_300M
0.1068
omniASR_CTC_1B
0.1116
whisper-small
0.1255
omniASR_CTC_300M
0.2011
whisper-base
0.2501
gemma-4-E2B
0.2711
whisper-tiny
0.3806
gemma-4-E4B
0.2304
Línia discontínua al 10% ≈ "habilitat d'un humà"
Què mesurem?
- (*) = servei de núvol: no s’executa en local i no en mesurem l’RTF.
- WER indica el percentatge de paraules mal transcrites i el CER el de caràcters (com més baixos, millor).
- L’RTF indica el temps de processament (com més alt, més lent). Importa la diferència entre models. Està calculat sobre una GPU Tesla T4 16GB.
- Avaluació feta amb 400 àudios d’exemple del corpus FLEURS.
- Diferències de menys d’un punt de WER no són significatives: si dos models estan a 4,8% i 5,1%, trieu per velocitat, memòria o llicència.
Nota: El sistema que fem servir per crear aquestes avaluacions està disponible com a codi obert: https://github.com/Softcatala/ai-eval-catalan