Cada equipo que crea productos impulsados por IA eventualmente llega a la misma encrucijada: ¿seguimos pagando por llamada API, invertimos en ejecutar nuestros propios modelos o ajustamos algo intermedio? La incómoda verdad es que la respuesta correcta cambia a medida que su producto evoluciona, y los equipos que revisan esta decisión regularmente superan a aquellos que la tratan como una elección arquitectónica única.
Ahí es donde entran las retrospectivas de la estrategia de IA. No como un ejercicio de moda, sino como una forma estructurada de observar datos de uso reales, costos reales y evaluaciones de calidad honestas para decidir si su enfoque actual todavía tiene sentido.
Los tres caminos (y por qué ninguno de ellos es permanente)
Seamos claros sobre lo que estamos comparando:
Comprar (basado en API): Llamas al OpenAI, Anthropic, a Google o al API de otro proveedor. Pagas por token. Obtienes los últimos modelos sin administrar la infraestructura. También acepta sus cambios de precios, límites de tarifas y cronogramas de desuso.
Compilación (autohospedada): Ejecuta modelos de peso abierto como Llama, Mistral o Qwen en su propia infraestructura. Tú controlas todo. También eres dueño de la carga de operaciones, los costos de GPU y la ruta de actualización.
Ajuste fino (personalizado): Se toma un modelo base, ya sea mediante el ajuste fino de un proveedor API o en su propia infraestructura, y se entrena con datos específicos de su dominio. Obtiene una mejor calidad para su caso de uso específico. También asume la complejidad del proceso de datos y el reentrenamiento continuo.
La mayoría de los equipos comienzan con Comprar. Es la decisión correcta desde el principio: todavía estás averiguando qué deben hacer tus funciones de IA. El error es permanecer en piloto automático después de que sus patrones de uso se vuelven claros.
Cuándo ejecutar una retrospectiva de la estrategia de IA
No los programe en un calendario fijo sólo porque alguien se lo indicó. Ejecute uno cuando algo realmente cambie:
- Su factura mensual API cruza un umbral que hace que alguien se estremezca. El número específico depende de su empresa, pero lo sabrá cuando Finanzas haga preguntas.
- Un modelo del que usted depende queda obsoleto o se le cambia el precio. Esto sucede con más frecuencia de lo que a nadie le gustaría. OpenAI ha retirado modelos repetidamente; Anthropic revisa los precios; Google pone fin a las cosas.
- Sus requisitos de calidad cambian. Tal vez lo lanzó con un chatbot y "suficientemente bueno" estaba bien, pero ahora está generando contenido que se envía a los clientes.
- Su volumen de datos cambia significativamente. Procesar 100.000 tokens por día es un problema diferente a procesar 10 millones.
- El lanzamiento de un nuevo modelo cambia el cálculo. Cuando un modelo que cuesta la mitad del costo ofrece una calidad comparable para su caso de uso, vale la pena discutirlo.
Si ninguna de estas cosas ha sucedido en el último trimestre, probablemente no necesite una retrospectiva. No hagas perder el tiempo a la gente.
Ejecución de la retrospectiva: un formato práctico
Bloque 90 minutos. Invite a las personas que realmente tocan la pila de IA: los ingenieros que construyen con ella, el gerente de producto que ve los patrones de uso y quien supervisa la factura. Omita a los ejecutivos a menos que tengan un contexto relevante.
Parte 1: Revisión de datos (30 minutos)
Comience con números, no con opiniones. Tire esto antes de la reunión:
Datos de uso — ¿Cuántos tokens/solicitudes por día, por función? ¿Cuál es la línea de tendencia? ¿Qué funciones están creciendo más rápidamente?
Datos de costos — ¿Cuánto estás gastando realmente, desglosado por función o caso de uso? ¿Cuál es el costo por interacción del usuario? ¿Cómo ha cambiado esto?
Datos de calidad — ¿Qué dice su conjunto de evaluaciones? Si no tiene un conjunto de evaluación, ese es su primer elemento de acción. Realice un seguimiento de las señales de calidad que tenga: puntuaciones de satisfacción del usuario, tasas de error, tasas de alucinaciones de verificaciones aleatorias o quejas de los clientes.
Datos de latencia — ¿Cuáles son sus tiempos de respuesta de p50 y p95? ¿Son aceptables para su UX?
Pon estos números en una pantalla compartida. Deja que la gente los absorba. La conversación que sigue será dramáticamente mejor con los datos frente a todos.
Parte 2: Análisis de opciones (30 minutos)
Para cada caso de uso importante, analice las tres opciones utilizando sus números reales:
Si nos quedamos en APIs:
- Costo proyectado a la tasa de crecimiento actual en 6 meses
- Dependencia de la hoja de ruta y los precios del proveedor
- Techo de calidad con modelo actual.
Si nos hospedamos nosotros mismos:
- Costo estimado de infraestructura (instancias de GPU, tiempo de operaciones, monitoreo)
- Tiempo de ingeniería para configurar y mantener.
- Comparación de calidad para sus tareas específicas (debe comparar esto, no adivinar)
- Implicaciones de latencia y rendimiento
Si afinamos:
- Disponibilidad y calidad de los datos de formación
- Costos estimados de capacitación e inferencia.
- Mejora de calidad esperada para su dominio
- Frecuencia de reentrenamiento y complejidad del proceso
Sea honesto acerca de lo que no sabe. "Necesitaríamos comparar Llama 3 en nuestro conjunto de evaluación antes de poder comparar la calidad" es un resultado perfectamente bueno de esta sección.
Parte 3: Decisiones y Acciones (30 minutos)
Apunte a uno de tres resultados por caso de uso:
- mantén el rumbo — el enfoque actual sigue siendo el que mejor se adapta. Documente el motivo para no volver a litigar esto la próxima vez.
- Realizar un experimento — algo parece prometedor pero necesitas datos. Defina el experimento: quién lo hace, qué miden, cuándo informan.
- Comprométete con una migración — los datos apoyan claramente un cambio. Definir el plan de migración con hitos.
Asigne un propietario a cada elemento de acción. Establezca una fecha de entrada. Escríbalo en algún lugar donde el equipo realmente mire.
Las compensaciones de las que nadie habla
La mayoría de los análisis de construcción versus compra se centran en el costo y la calidad. Eso es importante, pero hay factores más sutiles que a menudo determinan si una decisión realmente funciona:
La carga de operaciones es real. Autohospedar un modelo no es simplemente "poner en marcha una instancia de GPU". Se trata de monitorear, escalar, actualizar, manejar fallas a las 2 a.m. y mantenerse al día con los parches de seguridad. Si su equipo ya está al límite, agregar operaciones modelo podría costarle más en el cambio de contexto de lo que ahorra en tarifas API.
El ajuste es un compromiso, no una tarea de una sola vez. Su modelo ajustado comienza a degradarse en el momento en que el mundo deja de usar sus datos de entrenamiento. Necesita una canalización para recopilar nuevos ejemplos, evaluar el rendimiento, volver a capacitar e implementar. Si no está preparado para mantener ese ciclo, terminará con un modelo obsoleto que tiene un rendimiento inferior al de la última oferta API.
La dependencia del proveedor no se trata sólo del modelo. Se trata de las herramientas, la biblioteca de mensajes que haya creado, el marco de evaluación y el conocimiento institucional sobre cómo obtener buenos resultados. Cambiar de proveedor nunca es tan sencillo como cambiar un punto final API.
Los requisitos de latencia pueden forzar su decisión. Si necesita respuestas en menos de 200 ms, el autohospedaje podría ser su única opción para algunos tamaños de modelo. Por el contrario, si la latencia no importa mucho, la simplicidad operativa de APIs es difícil de superar.
El contexto regulatorio importa más de lo que la gente admite. Los casos de uso de atención médica, finanzas y gobierno a menudo no pueden enviar datos a terceros APIs independientemente del costo. El autohospedaje no es una opción en estos contextos: es un requisito.
Antipatrones retrospectivos comunes
La trampa de que "la hierba es más verde". Cada retrospectiva se convierte en un debate sobre el cambio a lo más nuevo. Solucione esto exigiendo puntos de referencia sobre sus datos reales antes de que cualquier opción sea objeto de discusión seria.
La defensa del costo hundido. "Ya hemos invertido en el autohospedaje, por lo que debemos seguir adelante". La inversión pasada no convierte en bueno un mal enfoque. Si el APIs se ha vuelto mucho más barato o mejor desde que hiciste esa llamada, reconócelo.
Parálisis del análisis. El equipo genera una hoja de cálculo de comparación masiva pero nunca decide nada. Establezca una fecha límite estricta: al final de esta reunión, nos comprometemos a realizar al menos una acción concreta por caso de uso.
Ignorando la capacidad del equipo. Una solución técnicamente óptima que su equipo no puede construir o mantener de manera realista no es realmente óptima. Considere lo que su gente realmente puede asumir teniendo en cuenta todo lo demás que tienen en sus manos.
Una plantilla de seguimiento ligera
No necesitas un panel elegante. Una tabla sencilla actualizada trimestralmente funciona:
| Caso de uso | Enfoque actual | Costo Mensual | Nivel de calidad | Activador de próxima revisión |
|---|---|---|---|---|
| Chat de atención al cliente | GPT-4o API | $X,XXX | 4.2/5 usuarios sentados | El costo supera Y o el modelo está obsoleto |
| Resumen de documentos | Llama 3 afinada | $X,XXX (infra) | 91% de precisión de la evaluación | La precisión cae por debajo del 88% |
| Generación de código | Copilot + Claudio API | $X,XXX | Satisfacción del desarrollador 3.8/5 | Fecha de lanzamiento o renovación del nuevo modelo. |
El punto no es el formato. Es que usted tiene un registro escrito de lo que decidió, por qué y qué desencadenaría una nueva visita.
El verdadero objetivo
Las retrospectivas de estrategias de IA no tratan de encontrar la única respuesta "correcta". Se trata de desarrollar el hábito de contrastar periódicamente sus suposiciones con la realidad. Los equipos a los que les va bien con la IA no son los que toman la decisión inicial perfecta: son los que notan cuándo cambia el panorama y se adaptan antes de que se convierta en una crisis.
Comience con los datos. Sea honesto acerca de las compensaciones. Toma una decisión. Vuelva a visitarlo cuando las circunstancias cambien. Ese es todo el marco.
Prueba NextRetro gratis — Ejecute su próxima retrospectiva de estrategias de IA con columnas estructuradas, aportes anónimos y votaciones para revelar lo que realmente piensa su equipo.
Última actualización: febrero 2026
Tiempo de lectura: 7 minutos