La intel·ligència artificial al vostre ordinador personal

Compartiu

Models de llenguatge grans

La nostra recomanació la trobareu en aquesta pàgina.

Per a determinar quin model és millor, avaluem les tasques més comunes que fan els usuaris: traducció, resums, donar instruccions, etc.

Avaluacions dels models que hem provat

Cada fila de la taula és un model que hem avaluat. Cada columna és una tasca diferent (respondre preguntes, resumir, traduir, etc). Per a cada tasca, passem el mateix conjunt de proves a tots els models i comparem la seva sortida amb una resposta de referència feta per humans. Com més s’hi acosta, més alta és la puntuació.

ModelMemòria (GB)tok/sSTSCatCoLA MCCCLUB QACaSumEN↔CAES↔CAIFEvalMantincCLAM
(*) gpt-6-astra0.85010.52440.79340.49150.63450.27750.88500.920070.29
(*) gemini-3-8-flash0.83290.52980.81520.48690.61060.21340.87500.930069.74
(*) gemini-3-1-preview0.82360.52980.81580.48970.63250.25500.82000.920069.18
(*) claude-opus-4-70.82080.61920.80390.51080.64670.27460.79500.820069.01
(*) gpt-5.4-mini0.76550.43630.79120.43460.61600.25840.80500.770063.43
qwen3.8-27b15.210.340.76160.41200.76370.45670.59750.25320.74500.840062.92
muse-glimmer-30b16.910.200.76220.30620.66170.34660.60200.24840.86000.840060.03
qwen3-14b7.919.550.68110.36530.71180.40380.55550.19340.75250.840058.99
gemma3-27b15.29.740.75990.36540.67640.26870.60660.26010.77750.826758.68
gemma4-26b14.647.530.70430.28390.78110.42680.56310.21740.70500.806758.54
qwen3.5-9b5.130.360.69980.25110.68700.41870.58330.24040.72000.896758.36
gemma3-12b6.820.670.69690.36080.67290.33890.59100.24330.76250.760057.27
mistral-small-24b13.512.730.69660.42480.63460.39540.58890.23470.66500.686755.93
gemma4-12b6.820.280.70220.27640.74600.39310.56660.20060.58500.796755.47
salamandra-7b3.936.090.31770.36430.74690.47680.58710.23790.35500.810049.76
llama3.1-8b4.533.730.45060.23570.70780.42090.56180.21600.53250.740049.66
gemma4-e4b2.246.310.65560.25830.60610.21170.51750.14970.64500.720049.00
ministral3-14b7.920.580.64560.27440.68000.34510.41120.00000.51750.643347.31
eurollm-9b5.128.440.37530.31120.68290.41180.59770.24360.45500.643347.15
gemma3-4b2.260.430.44200.32460.61440.25330.52240.17360.55500.746746.91
phi-4-14b7.919.120.62990.29570.46730.36210.54110.20900.52750.620046.82
ministral3-8b4.530.850.59130.28060.56410.32480.38910.04420.44000.653343.87
aya-expanse-8b4.531.380.57170.16140.68970.38410.45840.08980.37250.496742.15

CLAM
(*) gpt-6-astra
70.29
(*) gemini-3-8-flash
69.74
(*) gemini-3-1-preview
69.18
(*) claude-opus-4-7
69.01
(*) gpt-5.4-mini
63.43
qwen3.8-27b
62.92
muse-glimmer-30b
60.03
qwen3-14b
58.99
gemma3-27b
58.68
gemma4-26b
58.54
qwen3.5-9b
58.36
gemma3-12b
57.27
mistral-small-24b
55.93
gemma4-12b
55.47
salamandra-7b
49.76
llama3.1-8b
49.66
gemma4-e4b
49.00
ministral3-14b
47.31
eurollm-9b
47.15
gemma3-4b
46.91
phi-4-14b
46.82
ministral3-8b
43.87
aya-expanse-8b
42.15

Tingueu en compte

  • Els models amb el nom en negreta no els podeu executar a l’ordinador i els incloem només com a referència. Aquests models requereixen entre 80 i 150 vegades més memòria i computació que els models que usem a l’ordinador.
  • Tots els models locals estan avaluats amb quantització Q4_K_M (4 bits) que és la configuració que recomanem ja que permet tenir models més potents amb menys recursos.
  • Cada model s’avalua amb els mateixos 400 exemples per tasca. Diferències de menys de 2 punts de CLAM no són concloents: llegiu la taula per grups.
  • Cal tenir en compte la mida del model. Un model de 24B consumeix el doble que un 12B; llavors, més gran equival a més memòria.

Què mesurem?

  • Els tokens/s mesuren la velocitat de generació del model en un AMD RYZEN AI MAX+ PRO 395 w/ Radeon 8060S (maquinari de gamma alta).
  • STS: capacitat de jutjar si dues frases volen dir el mateix. El model assigna una puntuació de similaritat a parelles de frases i es calcula la correlació de Pearson (−1 a 1) amb les puntuacions donades per humans. Com més alta la correlació, millor.
  • catcola_mcc: detecció de gramaticalitat. El model classifica frases en català com a acceptables o no, i es compara amb l’etiqueta humana mitjançant el Matthews Correlation Coefficient (−1 a 1, on 0 equival a respondre a l’atzar i 1 a encertar-ho tot).
  • club_qa: mesura la comprensió lectora. Donat un text de la Viquipèdia i una pregunta, el model n’extreu la resposta. Es mesura la coincidència de paraules entre la resposta generada i l’esperada mitjançant F1 (0 a 1).
  • CaSum: capacitat de resumir. El model genera un resum d’un text i es compara amb un resum de referència humà mitjançant mètriques de solapament de paraules tipus ROUGE (0 a 1), que premien el contingut compartit entre els dos resums.
  • EN↔CA: qualitat de la traducció automàtica entre anglès i català. La puntuació és la mitjana del COMET normalitzat (0–1) de les dues direccions, EN→CA i CA→EN. Com més alta, millor.
  • ES↔CA: qualitat de la traducció automàtica entre castellà i català. La puntuació és la mitjana del COMET normalitzat (0–1) de les dues direccions, ES→CA i CA→ES. Com més alta, millor.
  • IFEval-ca: mesura la capacitat de seguir instruccions en català. Per exemple: “escriu la resposta en menys de 100 paraules”.
  • Mantinc: mesura la capacitat del model de mantenir el català en les respostes, fins i tot amb contextos en altres llengües o converses de diversos torns. La puntuació va de 0 a 1; com més alta, millor.
  • CLAM (Catalan Language Aggregate Metric) és el nostre índex agregat: la mitjana de les puntuacions normalitzades de totes les tasques d’avaluació. Cada puntuació es normalitza amb la fórmula (valor − baseline) / (1 − baseline), on la baseline és el resultat que obtindria un model responent a l’atzar. Per a les tasques de traducció, la puntuació COMET es normalitza respecte a una còpia de la font (copiar el text d’origen com a traducció) i no respecte d’un model aleatori. El CLAM serveix, doncs, per comparar models entre ells, i no s’ha de llegir com un percentatge d’encerts.

En totes les mètriques, com més alt és el nombre, millor. Gràcies a Meta, i als projectes Aina i IberBench per proporcionar els conjunts de dades d’avaluació.

Impacte de la quantització

Per la família de models Gemma 3, hem dut a terme una anàlisi més exhaustiva per entendre com la quantització, que redueix el consum de memòria i els requisits computacionals, afecta la qualitat dels resultats. En general, com més agressiva és la quantització (per exemple, Q2 amb 2 bits és més agressiu que Q4 amb 4 bits), més disminueix l’índex CLAM, fet que indica una pèrdua de qualitat en els resultats.

ModelQuantitzacióMemòria (GB)tok/sSTSCatCoLA MCCCLUB QACaSumEN↔CAES↔CAIFEvalMantincCLAM
gemma3-27b-q8q828.75.170.75580.38750.67690.26860.60630.26250.80250.830059.37
gemma3-27bq415.29.740.75990.36540.67640.26870.60660.26010.77750.826758.68
gemma3-27b-q2q28.913.230.70950.30700.61190.27650.59830.24040.71750.836755.41
gemma3-12b-q8q812.814.730.71530.38970.71410.34790.59600.24280.78000.763359.00
gemma3-12bq46.820.670.69690.36080.67290.33890.59100.24330.76250.760057.27
gemma3-12b-q2q23.926.340.64440.37060.68820.26710.56350.20670.69250.796754.92
gemma3-4b-q8q84.238.180.70220.31190.58510.39310.52190.17660.58500.740052.38
gemma3-4bq42.260.430.44200.32460.61440.25330.52240.17360.55500.746746.91
gemma3-4b-q2q21.356.980.35630.24070.59020.26390.41130.04600.40500.633338.83

Nota: El sistema que fem servir per crear aquestes avaluacions està disponible com a codi obert: https://github.com/Softcatala/ai-eval-catalan