La intel·ligència artificial al vostre ordinador personal

Compartiu

Models de transcripció

La nostra recomanació la trobareu en aquesta pàgina.

Avaluacions dels models que hem provat

ModelParàmetres (B)Memòria (GB)WER combinatWER FleursCER FleursWER OpenSLRCER OpenSLRRTF
(*) gpt-4o-transcribe0.03520.02840.01340.04190.0193
(*) gemini-3.8-flash0.04570.03430.01920.05710.0355
(*) gemini-3.1-pro-preview0.05630.04560.02700.06700.0422
projecte-aina/whisper-large-v3-ca-3catparla1.63.10.05930.06190.03390.05670.01900.3651
whisper-large-v3-turbo0.81.60.06290.05050.01730.07520.02850.0543
whisper-large-v31.63.10.06700.04820.01710.08580.03600.2297
whisper-medium0.81.50.09060.07400.02440.10720.04250.1531
omniASR_CTC_3B3.06.00.10890.09440.02800.12340.03570.1444
omniASR_LLM_300M1.63.30.11620.10680.03530.12560.03880.3173
omniASR_CTC_1B1.02.00.13090.11160.03410.15020.04190.0517
whisper-small0.20.50.14670.12550.04030.16790.06260.0740
omniASR_CTC_300M0.30.60.22490.20110.05370.24880.06650.0206
whisper-base0.10.10.27930.25010.08230.30850.12140.0435
gemma-4-E2B2.34.60.37610.27110.20880.48110.45690.3471
whisper-tiny0.00.10.39820.38060.13850.41570.18350.0325
gemma-4-E4B4.590.39860.23040.19640.56690.51643.5222
WER Fleurs
10% habilitat d'un humà
10% habilitat d'un humà
(*) gpt-4o-transcribe
0.0284
(*) gemini-3.8-flash
0.0343
(*) gemini-3.1-pro-preview
0.0456
projecte-aina/whisper-large-v3-ca-3catparla
0.0619
whisper-large-v3-turbo
0.0505
whisper-large-v3
0.0482
whisper-medium
0.0740
omniASR_CTC_3B
0.0944
omniASR_LLM_300M
0.1068
omniASR_CTC_1B
0.1116
whisper-small
0.1255
omniASR_CTC_300M
0.2011
whisper-base
0.2501
gemma-4-E2B
0.2711
whisper-tiny
0.3806
gemma-4-E4B
0.2304

Línia discontínua al 10% ≈ "habilitat d'un humà"

Què mesurem?

  • (*) = servei de núvol: no s’executa en local i no en mesurem l’RTF.
  • WER indica el percentatge de paraules mal transcrites i el CER el de caràcters (com més baixos, millor).
  • L’RTF indica el temps de processament (com més alt, més lent). Importa la diferència entre models. Està calculat sobre una GPU Tesla T4 16GB.
  • Avaluació feta amb 400 àudios d’exemple del corpus FLEURS.
  • Diferències de menys d’un punt de WER no són significatives: si dos models estan a 4,8% i 5,1%, trieu per velocitat, memòria o llicència.

Nota: El sistema que fem servir per crear aquestes avaluacions està disponible com a codi obert: https://github.com/Softcatala/ai-eval-catalan