Cada vez que alguien en un comité de arquitectura dice "metámosle IA", lo primero que pregunto es: ¿qué problema específico resuelve, y qué pasa cuando se equivoca? No es una pregunta retórica. Es la que separa una decisión de arquitectura seria de una moda pasajera.
No hace falta ser ingeniero de machine learning para participar en esa conversación. Pero sí hace falta manejar un puñado de conceptos que, en mi experiencia, casi nadie explica asumiendo que no sabes de qué está hablando. Van acá, sin fórmulas.
Un modelo no "sabe" nada, calcula probabilidades
Un modelo entrenado es una función con muchísimos parámetros ajustados a partir de datos. Cuando le das una entrada, no "piensa" ni "recuerda" en el sentido humano: calcula la salida más probable según los patrones que vio durante el entrenamiento. Esto importa para arquitectura porque cambia la pregunta que deberías hacerte. No es "¿el modelo es inteligente?", es "¿qué tan representativos fueron los datos de entrenamiento respecto a los casos que voy a enfrentar en producción?". Un modelo entrenado con datos de 2023 no sabe que existe una política nueva que publicaste ayer, y no hay forma de que lo intuya.
Entrenamiento vs. inferencia: dos costos completamente distintos
Entrenar un modelo es caro, lento y ocurre (casi siempre) una sola vez o de forma periódica. Inferencia es correr el modelo ya entrenado contra una entrada nueva, y es lo que pasa cada vez que un usuario hace una consulta. Como arquitecto, el costo que te va a doler todos los meses es el de inferencia: latencia, cómputo, y en el caso de proveedores externos, el precio por token o por llamada. Diseñar para IA sin modelar ese costo recurrente es el mismo error que diseñar una arquitectura sin modelar el costo de I/O — se ve bien en el prototipo y duele en la factura de producción.
Los LLM en particular: tokens, contexto y por qué alucinan
Un modelo de lenguaje no procesa palabras, procesa tokens (fragmentos de texto). Tiene una ventana de contexto limitada: todo lo que no entra en esa ventana, el modelo simplemente no lo "ve". Y cuando no tiene la información necesaria para responder, no siempre se detiene a decir "no sé" — genera la continuación estadísticamente más plausible, sea correcta o no. Eso es una alucinación: no es un bug aislado, es una consecuencia directa de cómo funciona el mecanismo. Cualquier sistema que ponga un LLM en el camino crítico de una decisión (financiera, médica, legal) sin un mecanismo de verificación externo está apostando, no arquitectando.
RAG: la respuesta pragmática al conocimiento desactualizado
Retrieval-Augmented Generation es, en esencia, buscar primero y generar después: en vez de confiar en lo que el modelo memorizó durante el entrenamiento, le inyectas en el prompt la información relevante y actualizada (sacada de tu base de datos, tu buscador vectorial, tus documentos) para que la use como contexto. No hace al modelo más inteligente, pero reduce el problema de "esto ya no es verdad" y te da algo mucho más valioso desde el punto de vista de arquitectura: trazabilidad. Podés mostrar de dónde salió la respuesta.
Lo que un arquitecto debería decidir (y lo que no)
No te corresponde ajustar hiperparámetros ni elegir la arquitectura de red neuronal — para eso está el equipo de ML, si lo tienes, o el proveedor del modelo si lo consumes como servicio. Lo que sí te corresponde, y nadie más va a hacer por ti, es definir los límites del sistema: qué pasa cuando el modelo falla o responde mal, cómo se audita una decisión que involucró IA, qué datos entran al prompt y cuáles jamás deberían entrar, y si el caso de uso tolera una tasa de error del 2%, del 10% o directamente no la tolera.
La IA no cambia los fundamentos de la arquitectura de software. Sigue siendo diseñar para el fallo, definir límites claros entre componentes y ser honesto sobre lo que el sistema puede y no puede garantizar. Solo que ahora uno de esos componentes, en vez de fallar de forma determinística, falla de forma probabilística — y ese es, quizás, el único concepto nuevo que realmente necesitas internalizar.