Models de decisió Jev
Un model Jev és un model d’intel·ligència artificial especialitzat a prendre decisions: rep un context i unes opcions, calcula la probabilitat de cadascuna i tria la més adequada. Serveix per classificar peticions, encaminar tasques o valorar respostes sense generar text lliure. El terme prové de Jev, un model comercial de l’empresa TypeSafe AI presentat el setembre de 2026, que va popularitzar aquest tipus d’eina. Els models que avaluem aquí són alternatives obertes, desenvolupades per altres projectes, que segueixen una interfície semblant i es poden executar en local. No tenen cap relació amb TypeSafe AI.
Avaluar els models Jev en català permet comprovar que classifiquen peticions, encaminen consultes, moderen continguts i seleccionen accions correctament, entenent les expressions i els matisos de la llengua.
| Model | Memòria (GB) | MASSIVE Taxa d’encert | MASSIVE Macro F1 | Decisions/s |
|---|---|---|---|---|
| Clef Flash 9B | 9.7 | 0.8924 | 0.8860 | 0.9 |
| Clef 27B | 28.7 | 0.8790 | 0.8756 | 0.2 |
| OpenJev 27B | 28.6 | 0.8416 | 0.8263 | 0.4 |
| Nimble 9B | 9.5 | 0.7972 | 0.7870 | 0.8 |
| lev 4B | 4.5 | 0.7707 | 0.7585 | 1.1 |
| Kev 4B | 4.5 | 0.7592 | 0.7492 | 2.5 |
| Kev 9B | 9.5 | 0.7461 | 0.7460 | 1.5 |
| Laya 421M | 0.4 | 0.2566 | 0.2244 | 21.9 |
| Julia 1 144M | 0.2 | 0.2303 | 0.2328 | 47.1 |
Dels models avaluats, Clef obté la taxa d’encert més alta en aquesta prova de classificació de peticions en català. En general, els models Jev no aporten més comprensió del català que el seu model base; el que aporten és una sortida estructurada, decisions sobre opcions fixes en una sola passada, útil per a encaminament d’intencions, o extracció d’esquemes quan no hi ha dades per entrenar un classificador.
Què mesurem?
Avaluem la capacitat dels models JEV per classificar peticions en català amb 2.974 mostres (de la partició test) de les 18 categories del conjunt de dades MASSIVE 1.1: calendari, transport, música, meteorologia, domòtica, etc. Per exemple, davant de «Quin temps farà demà?», el model ha de seleccionar la categoria de meteorologia. Tant les peticions com les instruccions i les descripcions de les categories són en català.
- Memòria (GB): mida dels pesos del model quantitzat. L’execució pot requerir memòria addicional
- Taxa d’encert: proporció de peticions classificades correctament. Un valor de 0,80 equival a un 80 % d’encerts. Com més alt, millor.
- Macro F1: combina la precisió i la capacitat de detectar les peticions de cada categoria, donant el mateix pes a totes. Permet detectar models que funcionen bé en les categories freqüents però fallen en les altres. Com més alt, millor.
- Decisions/s: nombre de peticions que el model pot classificar per segon. Com més alt, més ràpid. Els resultats depenen del maquinari utilitzat. La mesura que es mostra s’ha fet en un AMD RYZEN AI MAX+ PRO 395 w/ Radeon 8060S (maquinari de gamma alta).
Notes:
- Aquesta prova mesura la classificació de peticions en català; no avalua totes les tasques que poden fer aquests models, com ara moderar continguts o valorar respostes.
- Els models estan tots avaluats amb una quantització Q8_0.
Nota: El sistema que fem servir per crear aquestes avaluacions està disponible com a codi obert: https://github.com/Softcatala/ai-eval-catalan