Normativas Precios Blog
Tecnología

95,6% de acierto y 0% de invención: así supera Normatia a los grandes modelos de IA

Sometimos a Normatia y a los grandes modelos de IA a exámenes reales de oposición del Ayuntamiento de Madrid sobre CTE y RITE. Normatia obtiene un 95,6% de precisión con 0% de respuestas inventadas.

Introducción

¿Cómo saber si una IA es fiable para consultar normativa de edificación? No basta con que la respuesta suene convincente. La normativa técnica exige precisión: citar un artículo que no existe puede costar un requerimiento, un retraso en la licencia o un problema de responsabilidad profesional.

En Normatia decidimos medirlo con el estándar más exigente posible: exámenes reales de oposición. Las mismas preguntas que determinan quién accede a la administración pública. Las mismas condiciones para todos los modelos. Estos son los resultados.

La metodología: exámenes reales, condiciones idénticas

El benchmark se construyó sobre preguntas reales extraídas de convocatorias de oposición para Arquitecto y Arquitecto Técnico del Ayuntamiento de Madrid. Se utilizaron los exámenes de julio de 2025, julio de 2018 y febrero de 2019. Las materias evaluadas abarcan el CTE, el RITE, la Ley del Suelo y normativa urbanística de ámbito municipal y autonómico.

Todos los modelos fueron sometidos a condiciones idénticas: mismo prompt, misma ventana de contexto y configuración zero-shot, sin ejemplos previos que pudieran sesgar el resultado. La corrección se automatizó contra la plantilla oficial de cada tribunal. El mismo baremo para todas las respuestas.

El prompt utilizado fue el siguiente:

Eres experto en construcción y edificación. Resuélveme este examen tipo test. Tu respuesta debe ser un json estructurado así: { “respuestas”: [ { “id”: [ID_PREGUNTA], “opcion_correcta”: “[LETRA]” } ] }

Los datos brutos, los prompts completos y las respuestas de cada modelo están publicados en abierto en github.com/normatia/benchmarks para que cualquier profesional pueda auditar la metodología.

Los resultados: 27 puntos de diferencia

La tabla siguiente presenta los resultados globales del benchmark. Normatia alcanza un 95,6% de precisión media. El mejor modelo generalista se sitúa 20 puntos por detrás.

ModeloPrecisión mediaRespuestas inventadas
Normatia95,6%0%
Gemini 3.574,8%25,2%
Claude 4.671,5%28,5%
GPT 5.366,8%33,2%
Deepseek v461,9%38,1%

Fuente: Normatia Benchmark, mayo 2026. Datos completos en github.com/normatia/benchmarks.

El desglose por examen confirma la consistencia de Normatia frente a la dispersión de los modelos generalistas:

ExamenNormatiaGemini 3.5Claude 4.6GPT 5.3Deepseek v4
Arquitecto Técnico (Jul 2025)96,91%73,96%71,13%68,48%59,79%
Arquitecto Superior (Jul 2018)95,83%81,82%74,75%73,74%67,68%
Arquitecto Técnico (Feb 2019)94,19%68,60%68,60%58,14%58,14%

Fuente: Normatia Benchmark, mayo 2026. Datos completos en github.com/normatia/benchmarks.

La precisión de Normatia se mantiene estable entre el 94% y el 97% en los tres exámenes. Los modelos generalistas oscilan entre el 59% y el 82%. La diferencia media entre Normatia y el mejor modelo de propósito general es de aproximadamente 21 puntos. Frente al peor, la brecha supera los 33.

Pero el dato más relevante no está solo en el porcentaje de acierto.

El verdadero diferenciador: 0% de respuestas inventadas

Los modelos generalistas, cuando no conocen la respuesta, inventan. En el benchmark, entre el 25% y el 38% de sus respuestas eran incorrectas pero fueron presentadas con total seguridad, sin advertencias ni matices. En normativa de edificación, esto constituye un riesgo profesional inasumible.

Una respuesta inventada en un informe técnico puede desencadenar un requerimiento del colegio profesional, un retraso en la concesión de licencia o, en el peor de los casos, un problema de responsabilidad civil. La normativa no admite aproximaciones.

Normatia sigue un principio de diseño distinto. Cuando no localiza el artículo exacto en su base de datos, no responde. El 4,4% restante no son errores: son preguntas para las que Normatia prefirió abstenerse antes que inventar un valor o un número de artículo. Esa diferencia define dos filosofías opuestas frente a la precisión normativa.

Cabe señalar el axioma que guía el desarrollo del sistema:

Para un arquitecto o ingeniero colegiado, un sistema que confiesa ignorancia es una herramienta; un sistema que inventa un artículo es un riesgo insumible.

Ejemplos reales del examen

Para ilustrar la diferencia entre un motor de búsqueda normativa y un modelo generalista, se reproducen a continuación tres preguntas reales del examen de Arquitecto Técnico del Ayuntamiento de Madrid, convocatoria de julio de 2025.

Ley del Suelo. “Según el artículo 7 del Real Decreto 1492/2011, de 24 de octubre, por el que se aprueba el Reglamento de valoraciones de la Ley de Suelo, cuando el suelo estuviera en situación de rural, los terrenos se valorarán mediante: a) El método de comparación. b) El método residual estático. c) La capitalización de la renta anual real o potencial de la explotación.”

Normatia identifica correctamente la opción c, respaldada por el texto exacto del reglamento. Los modelos generalistas fallan: ni Gemini ni GPT localizan la referencia correcta y responden con métodos de valoración que el reglamento asigna a otras situaciones de suelo.

Ordenanzas municipales. “Según el artículo 6.10.21 de las normas urbanísticas del PGOU de Madrid, ¿en qué intervenciones será obligatorio el cumplimiento del factor verde? a) En todos los proyectos de edificación. b) En obras de nueva planta, sustitución, ampliación y rehabilitación. c) No aplica en edificios con protección patrimonial.”

Normatia acierta la opción b. Los modelos generalistas no tienen acceso al PGOU de Madrid y fallan de forma sistemática en todas las preguntas que involucran normativa municipal. Esta limitación es estructural: los grandes modelos de lenguaje no indexan ordenanzas municipales.

Normativa acústica. “Según el artículo 26 de la Ordenanza de Protección contra la Contaminación Acústica y Térmica de Madrid, los valores mínimos del aislamiento DnT,A entre una actividad TIPO 3.2 y un recinto docente son: a) 75 dB. b) 80 dB. c) 85 dB.”

Normatia responde correctamente la opción b. Los modelos generalistas alucinan valores de aislamiento que no figuran en la ordenanza. La diferencia es cualitativa: Normatia tiene las ordenanzas municipales indexadas y verificables; los modelos generalistas generan texto plausible a partir de patrones estadísticos, sin acceso al documento original.

No es perfecto. Es la mejor herramienta disponible.

Conviene ser precisos: Normatia no es perfecta. El 4,4% de preguntas sin respuesta demuestra que hay margen de mejora, especialmente en áreas donde la base documental aún se encuentra en ampliación. Pero en un sector donde el error tiene consecuencias legales y profesionales, la combinación de un 95,6% de precisión con un 0% de invención convierte a Normatia en la herramienta más fiable para consulta normativa con inteligencia artificial. Muy por encima de los modelos frontera.

Esta validación forma parte de un proceso continuo. En normatia.com/es/validacion-tecnica se publican periódicamente los resultados de nuevas evaluaciones y ampliaciones del corpus normativo.

Conclusión

El benchmark está publicado en abierto. Cualquier profesional puede auditar los datos, los prompts y las respuestas de cada modelo. La invitación queda hecha: que cada uno compruebe por sí mismo. Si alguien quiere replicar la prueba con otro modelo o con otro examen, el repositorio está abierto en github.com/normatia/benchmarks.

95% de precisión. 0% de respuestas inventadas. Datos públicos para que cualquiera pueda verificarlo.

ETIQUETAS:

benchmark inteligencia artificial normativa CTE oposiciones validación