← Volver al listado

Cómo saber si la IA aporta valor real a un estudio

En un estudio, una demostración de IA suele empezar por el dato más visible: "esto antes me llevaba dos horas y ahora lo tengo en veinte minutos". Conviene prestarle atención. También conviene no confundirlo todavía con valor.

La cuenta puede cambiar cuando añadimos el trabajo que queda fuera de la pantalla: preparar documentos, resolver excepciones, comprobar datos, corregir el formato o rehacer una parte. Incluso cuando el ahorro existe, falta saber qué permite hacer con ese tiempo y si el resultado mantiene la calidad necesaria.

Y puede ocurrir lo contrario. Un uso que apenas reduce minutos puede mejorar la consistencia de una documentación, facilitar una decisión o conservar una referencia que antes se perdía. El cronómetro importa, pero no describe por sí solo el resultado profesional.

Medir el valor de la IA en un estudio de arquitectura consiste, en realidad, en evaluar una forma de trabajar. Hay que delimitar el problema, comparar resultados equivalentes, contar el coste completo y decidir qué hacer con la evidencia. Esa es la tesis de este artículo.

Usar más IA no demuestra que el estudio trabaje mejor

La adopción declarada de IA está creciendo en arquitectura. En el RIBA AI Report 2025, cerca del 60 % de las prácticas encuestadas declaró utilizar IA, frente al 41 % en la edición anterior. Entre las prácticas usuarias que respondieron sobre eficiencia del diseño, el 34 % declaró una mejora, el 34 % expresó desacuerdo y el 33 % se mantuvo neutral. Son percepciones recogidas en una encuesta sectorial, no una medición causal de productividad.

La distancia entre adopción y beneficio importa. Una herramienta puede extenderse porque es accesible, porque genera curiosidad o porque resuelve bien algunas tareas aisladas. Ninguna de esas razones garantiza por sí sola que el estudio funcione mejor.

Contar cuántas personas usan IA tampoco basta. Un equipo puede utilizarla todos los días y seguir duplicando trabajo, revisando tarde o produciendo documentos inconsistentes. Del mismo modo, una única aplicación bien elegida puede reducir una fricción importante aunque solo intervenga unas pocas veces al mes.

La pregunta útil no es "¿cuánto usamos IA?", sino "¿qué resultado profesional mejora y qué nos cuesta conseguirlo?". Ese cambio parece pequeño, pero evita evaluar la tecnología por su presencia y obliga a evaluarla por sus efectos.

La unidad de medida no es la herramienta: es la tarea y su resultado

Decir que ChatGPT, Copilot o cualquier otra solución "aporta valor" es demasiado amplio. Una misma herramienta puede ser útil para preparar una primera estructura de propuesta y poco fiable para interpretar un requisito normativo. Incluso dentro de una misma tarea, el resultado depende de las fuentes, las instrucciones, la revisión y el contexto.

La unidad de evaluación debe ser concreta: un uso de IA dentro de una tarea delimitada. Por ejemplo: transformar notas de reunión en un primer borrador de acta; localizar requisitos en un pliego; preparar una estructura inicial de propuesta; clasificar documentación recibida o comparar versiones de una memoria.

A partir de ahí se define el resultado que importa. En un acta puede ser reducir el tiempo de preparación sin aumentar omisiones. En un pliego, localizar requisitos con su referencia a la fuente. En una propuesta, mejorar el tiempo de respuesta sin perder coherencia ni personalización. En documentación interna, facilitar que otra persona encuentre y reutilice información válida.

La herramienta queda en segundo plano. Lo que se evalúa es si esa forma de trabajar mejora un resultado que el estudio reconoce como relevante.

Las cinco preguntas de una prueba útil

Antes de desplegar indicadores, conviene responder cinco preguntas. Si alguna no está clara, la medición corre el riesgo de producir números sin una decisión detrás.

1. Qué problema queremos mejorar

"Ahorrar tiempo" suele ser una respuesta demasiado genérica. ¿Dónde se pierde ese tiempo? ¿En buscar información, producir un primer borrador, comprobar datos, corregir formatos o coordinar a varias personas? Dos tareas que consumen las mismas horas pueden necesitar soluciones completamente distintas.

El problema debe formularse de manera observable. Por ejemplo: "la revisión inicial de pliegos exige muchas horas y aun así existe riesgo de omitir requisitos" o "las actas tardan en circular y las tareas quedan dispersas". Esta formulación permite después comprobar si la IA mejora algo más que la velocidad aparente.

2. Contra qué situación vamos a comparar

Sin línea base no hay una comparación razonable. Antes de probar la IA necesitamos saber, aunque sea de forma aproximada, cuánto tarda hoy la tarea, qué errores aparecen, cuántas correcciones requiere y quién interviene.

No hace falta convertir el estudio en un laboratorio. En muchas tareas basta con revisar varios casos recientes o registrar durante unos días el método actual. Lo importante es evitar comparar una demostración especialmente favorable con una percepción imprecisa del trabajo anterior.

La comparación debe hacerse entre resultados equivalentes. No sirve enfrentar un borrador generado en cinco minutos con un documento tradicional ya revisado y listo para enviar. Hay que comparar dos salidas con un nivel de calidad y validación semejante.

3. Qué cuesta realmente conseguir el resultado

El tiempo de generación es solo una parte del coste. También cuentan la preparación de documentos, la limpieza de información, el diseño de instrucciones, la formación, la verificación, las correcciones, el mantenimiento y las excepciones.

El AIA AI Firm Toolkit plantea esta cuestión de forma directa: el beneficio neto existe cuando el tiempo total de generación y verificación mejora el enfoque tradicional. También recomienda observar errores y retrabajo, no solo utilización.

Este criterio evita una trampa habitual. Una primera salida puede aparecer casi de inmediato y, aun así, exigir tanta comprobación que el balance final sea neutro o negativo. La rapidez de la interfaz no equivale a productividad del estudio.

4. Qué mejora y qué puede empeorar

Una prueba útil no busca únicamente confirmar beneficios. También observa efectos no deseados. Puede mejorar el tiempo y empeorar la precisión. Puede homogeneizar el formato y empobrecer el criterio. Puede facilitar una tarea individual y complicar la coordinación. Puede generar más alternativas, pero aumentar el tiempo necesario para elegir entre ellas.

En arquitectura, ingeniería y construcción esta lectura es especialmente importante porque muchos resultados forman parte de una cadena de decisiones técnicas, documentales, económicas o contractuales. La IA puede asistir, pero la responsabilidad profesional no desaparece. Cuando el uso afecta a información sensible, normativa o entregables, el coste y la profundidad de la revisión deben formar parte de la evaluación, especialmente cuando se analizan los riesgos y la responsabilidad profesional asociados al uso de IA generativa en arquitectura.

5. Qué decisión tomaremos con la evidencia

Medir sin decidir solo añade trabajo. Antes de empezar conviene acordar qué resultados justificarían mantener el uso, qué problemas exigirían ajustarlo, qué condiciones recomendarían posponerlo y qué señales indicarían que debe abandonarse.

La decisión no siempre es "implantar" o "descartar". Un uso puede funcionar bien para un tipo de documento y no para otro; para una primera lectura, pero no para una conclusión; o en manos de una persona experta, aunque todavía no sea transferible al equipo. Eso no elimina automáticamente su valor. Obliga a nombrar su alcance: capacidad individual, piloto acotado o práctica compartida.

Qué medir sin convertir el estudio en un laboratorio

No todas las tareas necesitan los mismos indicadores. Elegir dos o tres dimensiones vinculadas al problema inicial suele ser suficiente, siempre que se observen en varios casos comparables. El número no puede fijarse de forma universal: dependerá de la frecuencia, variabilidad y riesgo de la tarea. La prueba debe ser ligera, pero no tan breve que convierta una excepción favorable en regla.

Tiempo y coste netos

El dato relevante es el tiempo total necesario para obtener una salida válida, no los segundos que tarda la herramienta en generar una respuesta.

  • Tiempo de preparación de entradas y contexto.
  • Tiempo de generación y selección de resultados.
  • Tiempo de verificación, corrección y cierre.
  • Tiempo de formación, configuración y mantenimiento cuando sea significativo.
  • Coste de licencias o soporte imputable al uso.

Convertir automáticamente cada hora en euros también puede resultar engañoso. El ahorro solo produce un efecto económico directo si cambia la capacidad, el plazo, el coste o el tipo de trabajo que puede asumir el estudio. Aun así, el tiempo liberado puede tener valor aunque se destine a revisar mejor, coordinar o reducir presión. Conviene explicar qué efecto produce, no asignarle un precio ficticio.

Calidad, errores y retrabajo

La calidad debe observarse con criterios concretos: omisiones, afirmaciones sin fuente, incoherencias, correcciones necesarias, cumplimiento de estructura o utilidad para la persona que recibe el resultado. En tareas repetidas puede compararse cuántos errores aparecen con y sin asistencia de IA y cuánto retrabajo exige cada método.

Una salida más fluida o mejor redactada no siempre es más correcta. En la pregunta del RIBA AI Report 2025 dirigida a las prácticas encuestadas que declararon utilizar IA, el 16 % manifestó que su uso había mejorado la precisión de las especificaciones y el 50 % expresó desacuerdo. Es una respuesta declarada, no una auditoría de documentos ni una conclusión aplicable a todas las herramientas. Sirve para algo más acotado: recordar que eficiencia percibida y precisión no son sinónimos.

Riesgo, control y trazabilidad

En algunas tareas el principal valor no está en hacer más, sino en conservar mejor la referencia, detectar una excepción o facilitar la revisión. Pueden registrarse omisiones críticas, capacidad de volver a la fuente, incidencias de privacidad, decisiones que requieren intervención profesional y facilidad para explicar cómo se obtuvo el resultado.

El NIST AI Risk Management Framework resulta útil como marco general porque integra beneficios y efectos negativos dentro del contexto de uso. No ofrece una fórmula financiera para un estudio de arquitectura, pero sí refuerza una idea importante: el desempeño de un sistema no puede separarse de sus riesgos y condiciones de uso.

Capacidad, adopción y experiencia

Un uso puede ser eficaz en manos de quien lo ha diseñado y fallar cuando intenta aplicarlo otra persona. Puede seguir siendo útil como apoyo individual o piloto acotado. Si el objetivo es convertirlo en una capacidad del estudio, entonces sí conviene observar si el equipo entiende el procedimiento, puede repetirlo, reconoce sus límites y sabe cuándo pedir revisión.

También importa la experiencia de quienes participan: si la tarea reduce fricción o la desplaza; si facilita coordinación o añade pasos; si el resultado ayuda al cliente o crea una capa más de comprobación. Estas señales son cualitativas, pero pueden recogerse con preguntas breves y ejemplos concretos.

Un ejemplo AEC: evaluar la revisión inicial de un pliego

Pensemos en un estudio que quiere utilizar IA para una primera revisión de pliegos. El objetivo no es sustituir la lectura profesional ni decidir si presentarse. Se busca preparar una ficha inicial con fechas, solvencia, documentación exigida, criterios, alertas y referencia a la fuente, dentro de un proceso de trabajo con IA en arquitectura que defina qué documentación entra, qué pasos se realizan, qué salida se espera y dónde interviene la revisión profesional.

La línea base puede construirse con tres o cuatro pliegos ya revisados: tiempo total, omisiones detectadas después, número de correcciones y dificultad para localizar el origen de cada dato. Después se prueba el uso asistido con varios documentos de complejidad comparable.

En cada caso se registra:

  • Tiempo de preparar y cargar la documentación.
  • Tiempo de generación de la ficha.
  • Tiempo de comprobarla contra el pliego.
  • Requisitos omitidos o interpretados de forma incorrecta.
  • Datos que conservan una referencia verificable a la fuente.
  • Excepciones que obligan a detener el proceso y pedir criterio.

Autodesk publica un caso de cliente sobre PCL Construction, organización que utilizó Pype AutoSpecs para generar registros de submittals a partir de especificaciones. En este contexto, los submittals son los entregables o documentación que deben presentarse para revisión o aprobación conforme a esas especificaciones: por ejemplo, planos de taller, fichas o datos de producto, muestras u otros equivalentes. La publicación describe la experiencia de PCL; no es una evaluación independiente ni demuestra que otro estudio vaya a obtener el mismo resultado. Su interés aquí es más acotado: una tarea concreta, una fricción reconocible y la necesidad de mantener la verificación.

Imaginemos un resultado contradictorio: la ficha reduce cuarenta minutos por pliego, pero en uno de los casos omite una condición de solvencia. No basta con promediar tiempos y errores. Hay que valorar la gravedad de la omisión, si la revisión prevista la detecta, su consecuencia profesional o contractual, la frecuencia con que aparece, el coste de comprobarla y el ahorro que sigue quedando. Confundir una errata formal con perder una fecha límite o un requisito determinante cambiaría por completo la decisión. En ese supuesto, lo razonable puede ser ajustar el procedimiento, mejorar las entradas, exigir referencias y reforzar una comprobación concreta, no ampliarlo todavía. Si la omisión no es detectable de forma fiable o el control elimina el ahorro, conviene posponer o abandonar. Esta ilustración es hipotética: sirve para mostrar cómo interpretar evidencia contrapuesta, no para convertir la decisión en una fórmula.

Cuándo mantener, ajustar, ampliar o abandonar un uso

Mantener tiene sentido cuando el resultado mejora de forma consistente, el coste total es razonable y los riesgos están controlados. Ajustar es preferible cuando existe valor, pero aparecen fallos identificables en las entradas, instrucciones, fuentes o revisión.

Ampliar requiere algo más que un caso brillante. Conviene comprobar varios ejemplos, documentar el procedimiento mínimo, definir responsable y asegurar que otras personas pueden utilizarlo sin depender de conocimiento invisible. Convertir ese aprendizaje en conocimiento reutilizable permite integrarlo en la gestión del conocimiento del estudio y evitar que la mejora dependa de una sola persona.

Abandonar también es una decisión válida. Si verificar exige rehacer la tarea, si la variabilidad es excesiva, si la información no puede tratarse con garantías o si la calidad empeora, insistir puede consumir más recursos que el problema original.

Hay una quinta posibilidad: posponer. A veces el uso parece prometedor, pero el estudio todavía no dispone de fuentes ordenadas, criterios compartidos o suficientes casos. El primer trabajo no sería automatizar, sino preparar las condiciones que permitirían evaluarlo con rigor.

El valor real empieza cuando la prueba cambia una decisión

El valor de esta prueba no está en producir una etiqueta definitiva para cada uso. Está en evitar que una impresión inicial decida por el estudio.

Cuando la evidencia es suficiente, permite avanzar con un alcance definido. Cuando no lo es, ayuda a proteger tiempo y responsabilidad profesional: mantiene la decisión abierta, delimita qué debe observarse después y evita ampliar por inercia.