Models de llenguatge grans
Per a determinar quin model és millor, avaluem les tasques més comunes que fan els usuaris: reformulació, traducció, resums, etc.
Tingueu en compte
- Els models amb el nom en negreta no els podeu executar a l’ordinador i els incloem només com a referència. Aquests models requereixen entre 80 i 150 vegades més memòria i computació que els models que usem a l’ordinador.
- Cal tenir en compte la mida del model. Un model 24B consumeix el doble que un 12B; llavors, més gran equival a més memòria.
Què mesurem?
- sts_ca: mesura la capacitat de reformular frases.
- catcola_mcc: mesura la capacitat del model de detectar si una frase en català és gramaticalment acceptable o no (classificació binària).
- club_qa_em: mesura si el model extreu correctament la resposta d’un text de la Viquipèdia en català feta una pregunta.
- casum_rougeL: mesura la capacitat de fer resums d’un text.
- flores_en2ca / flores_ca2en : mesura la qualitat de la traducció automàtica en les direccions anglès → català i català → anglès.
- índex agregat: és la mitjana de les puntuacions normalitzades de cada tasca d’avaluació. Cada puntuació es normalitza amb la fórmula (valor – baseline) / (1 – baseline), eliminant la variació aleatòria, i el resultat final s’expressa en percentatge (0–100).
Models de transcripció
Actualment, hi ha models com ara Omnilingual ASR de Meta o Whisper d’OpenAI.
Si heu de transcriure programes de televisió o ràdio en català, el model whisper-large-v3-ca-3catparla del projecte Aina, entrenat amb 710 hores de TV catalana, pot donar millors resultats que el Whisper estàndard en aquest domini específic.
A sota teniu una avaluació feta amb 200 àudios d’exemple del corpus FLEURS. El WER indica el percentatge de paraules mal transcrites i el CER el de caràcters (com més baixos, millor). L’RTF indica el temps de processament (com més alt, més lent).