MaisMedia Lab · Estudo anual · Resultados
Estado da lingua galega nas IAs 2026
Cada vez máis xente pregunta ás máquinas en vez de buscar nun buscador. Se o modelo responde mal
en galego — ou responde en castelán — a lingua perde terreo dixital. Medimos, con método público,
como se portan ChatGPT, Gemini, Claude, Copilot e DeepSeek co galego. Estas son
as notas da primeira edición.
A clasificación final
| # | Modelo (nivel gratuíto) | Nota /100 |
| 1 | DeepSeek | 100 |
| 2 | Claude Sonnet | 99 |
| 2 | ChatGPT | 99 |
| 4 | Gemini 3.6 Flash | 98 |
| 5 | Copilot (Smart) | 95 |
Probas feitas o 12 de setembro de 2026, todos os modelos en nivel gratuíto (Copilot en modo
Smart). As deducións, unha a unha e coa súa razón, están na folla de puntuacións: o xerundio
de posterioridade caeulles a ChatGPT e Copilot, a concordancia de xénero («coa mellor
leite galega») a Gemini e Copilot, e un dato de poboación inventado con cita
oficial inexistente, a Copilot.
Os catro achados
1. O perigo non estaba onde pensabamos
Na proba de persistencia (B3) preguntámoslles datos factuais en galego, sen avisar. As cinco responderon en galego — ningunha mudou ao castelán. O fallo do galego nas IAs non está hoxe en abandonar a lingua: está na finura.
2. A alucinación con nome e apelidos
Copilot deu 302.250 habitantes «segundo o último padrón continuo oficial do INE (2026)». Esa cifra non existe e ese padrón non está declarado: o oficial a 1/1/2025 é 326.013 (real decreto 1117/2025). Verificámolo contra o INE, o IGE e o BOE. Os seus cinco concellos, iso si: exactos ao dígito.
3. Os erros repítense entre modelos
O xerundio de posterioridade («estamos xestionando», «estamos revisando») caeulles a ChatGPT e Copilot. A concordancia de xénero («coa mellor leite galega») a Gemini e Copilot. Non son anécdotas illadas: son patróns.
4. As IAs non son deterministas
Claude fixo a batería en dúas execucións seguidas, cos mesmos prompts. A primeira non tivo ningún erro; a segunda engadiu un desliz novo («praza monumentais»). Repetir a proba non garante repetir a calidade — e por iso publicamos as respostas completas.
Un experimento accidental: o mesmo modelo, dous modos
Claude fixo a batería en modo alto e en modo medio. O modo alto escribiu lingua perfecta
(100) pero fixo esperar máis de cinco minutos. O modo medio respondeu de inmediato e cometeu
un único desliz («praza monumentais»): 99. Conclusión práctica para calquera negocio:
máis tempo pensando non garante máis calidade — o desliz apareceu xustamente
na execución rápida.
Para as empresas: que significa isto?
Se vas montar un chatbot, unha automatización ou contidos en galego: os cinco modelos
cumpren a norma a un nivel que fai anos era inimaxinable — e os cinco gratuítos. Ao elixir
entre eles pesan o prezo, a latencia e a integración, non o galego. E o que non cambia:
esixe sempre mostras en galego antes de pagar, porque o que fallou hoxe (un dato
inventado, un xerundio) non o ve ninguén ata que pasa.
Descargas: batería, respostas e puntuacións
Metodoloxía
Dúas conversas novas por modelo (a proba de persistencia, soa e a primeira; o resto agrupado),
prompts literais, versión e plan anotados, capturas de pantalla de todas as respostas. Puntuación
coa rúbrica pública v1.4. A iniciativa é do MaisMedia Lab: medimos as
máquinas, non as empresas — sen patrocinio nin fabricante detrás.
A v1.4 quedou curta (media 98,4): a edición 2027 engadirá probas que separen máis — sintaxe
complexa, galego coloquial fronte ao normativo, e voz.