Publicado en

La IA está en el taller, no dentro del instrumento

Cuando presenté la beta 2 de UXMachine en LinkedIn escribí una frase que se me ha quedado pegada: «La IA está en el taller, no dentro del instrumento».

Me gusta porque resume algo que no había previsto cuando empecé. UXMachine existe porque trabajo con agentes. Me ayudan a programar, revisar, probar, discutir decisiones y no perder del todo el hilo de un proyecto que ha cambiado de dirección más de una vez. Sin ellos, siendo sincero, probablemente no lo habría podido construir solo.

Pero la herramienta que hoy analiza una web ya no utiliza ningún LLM. Ni para diagnosticar, ni para decidir qué entra en el informe, ni para redactarlo.

No empecé con esa idea. Fui llegando hasta ahí cuando me di cuenta de que el producto que creía estar haciendo no era exactamente el que tenía delante.

El problema no era que el modelo se equivocara

En el post de lanzamiento ya conté que la primera versión era bastante más simple. Le pasaba una URL a un modelo, le pedía que analizara la web y convertía su respuesta en un informe de UX.

Funcionaba sorprendentemente bien. Hasta que empecé a mirar de dónde salía cada afirmación.

No es que todas las recomendaciones fueran malas. Algunas eran buenas. Otras, discutibles. Y unas cuantas podían haberse escrito sobre casi cualquier web. El problema era otro: todas llegaban con el mismo tono de seguridad. Resultaba difícil distinguir lo que el modelo había visto en esa página de lo que sabía, en general, sobre UX.

Durante un tiempo intenté arreglarlo mejorando las instrucciones: pedir más precisión, exigir evidencias, acotar las conclusiones, obligar al modelo a reconocer sus límites. Parecía lo lógico.

Cada cambio hacía que el informe pareciera más riguroso. No estoy seguro de que lo fuera.

Un modelo también sabe redactar muy bien sus cautelas. Puede poner un «probablemente», citar un elemento de la página y montar una justificación razonable. La pregunta seguía siendo la misma: ¿la evidencia había llevado a la conclusión o había sido escogida después para justificarla?

Cuanto más tiraba de ese hilo, más claro lo veía: no estaba mejorando un prompt. Estaba intentando convertir un redactor en un instrumento de medida. Y quizá le estaba pidiendo algo para lo que no está especialmente hecho.

Cuando mejorar el producto significó quitar cosas

El cambio no fue limpio. Fue una sucesión de pruebas, frases que no podía defender, mediciones que no medían exactamente lo que yo pensaba y reglas que aguantaban hasta que aparecía una página que las rompía.

Poco a poco fui dándole la vuelta al orden. Primero, UXMachine abre la web en un navegador de verdad y la mira en unas condiciones conocidas. Después, mide siempre las mismas cosas. Solo entonces decide si existe evidencia suficiente para que una frase entre en el informe.

Hoy abre la web en móvil y en ordenador, recorre hasta once páginas y aplica las mismas siete comprobaciones. Las frases del informe están escritas de antemano, junto con la condición que permite usarlas y el límite de lo que pueden afirmar. La página aporta los datos, pero no inspira una interpretación nueva cada vez.

Inevitablemente, eso hace que el producto encuentre menos cosas. Bastantes menos, seguro, que si dejara a un modelo hablar de todo lo que ve.

Durante bastante tiempo viví esa reducción como una pérdida. Si el primer prototipo podía comentar el titular, la propuesta de valor, la jerarquía, el tono y casi cualquier elemento de la página, ¿cómo iba a ser mejor una versión que renunciaba a buena parte de eso a propósito?

La respuesta que me he ido dando —todavía con alguna duda— es que la amplitud vale de poco si no sabes separar lo observado de lo supuesto. En ese caso, más recomendaciones no significan un diagnóstico mejor. Significan más trabajo para averiguar cuáles merecen convertirse en una decisión.

Ahora UXMachine no intenta opinar de cualquier cosa. Dice lo que ha podido medir y deja constancia de lo que no ha podido comprobar. Es una herramienta más limitada que la que imaginé al empezar. También sé explicar mucho mejor qué hace.

¿Puede ser IA-first un producto sin un LLM dentro?

La pregunta suena un poco a juego de palabras, pero a mí me sirve porque obliga a no mezclar dos cosas.

Una es utilizar IA para construir un producto.

Otra es que ese producto necesite IA generativa para hacer su trabajo.

En UXMachine los agentes están muy presentes durante la construcción. Me ayudan a explorar alternativas, revisar código, encontrar contradicciones y cuestionar decisiones que, trabajando solo, sería fácil dar por buenas demasiado pronto. Ahí puedo discutir lo que me proponen, pedir otra lectura o descartarlo por completo.

Dentro del diagnóstico es distinto. Quien recibe el informe no tendría que reconstruir la conversación que hubo detrás ni preguntarse si una frase está ahí porque la respalda una medida o simplemente porque sonaba bien.

Quizá trabajar de forma IA-first no consista en meter un modelo en todos los sitios donde técnicamente cabe. Consiste también en decidir qué papel le das y qué pasa cuando se sale de ese papel.

En mi caso, la IA ha sido enormemente útil para construir el instrumento. Pero, al menos por ahora, el instrumento funciona mejor sin ella.

No quiero convertir esto en un dogma. Puede que más adelante encuentre un lugar donde una capa interpretativa aporte valor sin mezclarse con la observación. También puede que me haya pasado de prudente y haya construido algo demasiado estrecho. Todavía no lo sé.

Para eso está la beta.

Lo que toca comprobar ahora

La beta 2 no tiene que demostrar que soy capaz de montar un sistema trazable. Eso, con sus errores y sus límites, ya lo he podido comprobar desde dentro.

Lo que no sé es si esa trazabilidad le sirve a alguien más.

¿Compensa recibir menos hallazgos si cada uno se puede seguir hasta la medida que lo sostiene? ¿El informe ayuda de verdad a decidir qué tocar? ¿Declara bien sus límites o simplemente deja demasiadas cosas fuera? ¿Hay un punto en el que tanta prudencia deja de ser útil?

Esas preguntas no se resuelven mejorando otra vez el sistema desde dentro. Necesitan páginas que yo no haya elegido y personas que no lleven meses siguiendo todo este razonamiento.

Por eso he abierto la beta 2 de UXMachine. No busco tanto que me digan si les gusta como comprobar si, después de leer un informe, tienen más claro qué hacer. Y, cuando no sea así, entender qué ha faltado.

De momento, esta es mi conclusión provisional: he utilizado IA para construir una herramienta que ha terminado prescindiendo de ella justo donde al principio parecía más necesaria.

No sé si será la decisión definitiva. Sí sé que, hoy, es la que me permite responder mejor por cada frase que aparece en el informe.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.