Avaluacions prova de concepte

Compartiu

Models de llenguatge grans

Per a determinar quin model és millor, avaluem les tasques més comunes que fan els usuaris: reformulació, traducció, resums,  etc.

Tingueu en compte

  • Els models amb el nom en negreta no els podeu executar a l’ordinador i els incloem només com a referència. Aquests models requereixen entre 80 i 150 vegades més memòria i computació que els models que usem a l’ordinador.
  • Cal tenir en compte la mida del model. Un model 24B consumeix el doble que un 12B; llavors, més gran equival a més memòria.

Què mesurem?

  • sts_ca: mesura la capacitat de reformular frases.
  • catcola_mcc: mesura la capacitat del model de detectar si una frase en català és gramaticalment acceptable o no (classificació binària).
  • club_qa_em: mesura si el model extreu correctament la resposta d’un text de la Viquipèdia en català feta una pregunta.
  • casum_rougeL: mesura la capacitat de fer resums d’un text.
  • flores_en2ca / flores_ca2en : mesura la qualitat de la traducció automàtica en les direccions anglès → català i català → anglès.
  • índex agregat: és la mitjana de les puntuacions normalitzades de cada tasca d’avaluació. Cada puntuació es normalitza amb la fórmula (valor – baseline) / (1 – baseline), eliminant la variació aleatòria, i el resultat final s’expressa en percentatge (0–100).

Models de transcripció

Actualment, hi ha models com ara Omnilingual ASR de Meta o Whisper d’OpenAI.

Si heu de transcriure programes de televisió o ràdio en català, el model whisper-large-v3-ca-3catparla del projecte Aina, entrenat amb 710 hores de TV catalana, pot donar millors resultats que el Whisper estàndard en aquest domini específic.

A sota teniu una avaluació feta amb 200 àudios d’exemple del corpus FLEURS. El WER indica el percentatge de paraules mal transcrites i el CER el de caràcters (com més baixos, millor). L’RTF indica el temps de processament (com més alt, més lent).