Un equipo de ingeniería de startup de IA sigue un manual nuevo. Las herramientas modernas hacen que 3 a 5 ingenieros entreguen lo que exigía 15 en 2020, y el cuello de botella migró de escribir código a evaluar modelos y costear inferencia. Una estructura esbelta con los cargos correctos desde el día 1 evita seis meses de retrabajo.
Solo seniors hasta el product-market fit
Contrata 3 a 5 ingenieros seniors y deja la capa junior para después de la tracción. El producto cambia de forma cada semana en la fase inicial; la seniority absorbe el pivote sin rehacer fundamentos. Un equipo grande multiplica canales de comunicación, y la comunicación es el recurso escaso en los primeros meses.
Dos cargos que valen más que otro full-stack
El evaluation engineer cuida las suites de evaluación y los portones de calidad; sin él, una feature de IA retrocede en silencio y el cliente lo descubre antes que tú. El ingeniero de datos construye pipelines de corpus: ingesta, limpieza y versionado de los datos que alimentan modelos. Los dos roles sostienen calidad de producto de formas que otro generalista no sostiene.
El costo de inferencia entra en la arquitectura el día 1
El gasto de tokens por usuario, el routing entre modelos y la estrategia de cache pertenecen al documento de arquitectura original. El control de costo añadido después quema seis meses de refactorización. Pon metas sobre el papel: costo de inferencia por usuario activo, margen bruto por plan, techo de gasto por petición.
Empieza por API antes de pensar en GPU propia
Las APIs de Anthropic, OpenAI y Google cubren el 90% de los casos en la fase inicial. El fine-tuning o un modelo self-hosted entran cuando la unidad económica prueba la necesidad: volumen alto, costo de API comprimiendo margen o requisito de privacidad contractual. La infraestructura prematura mata startups antes de la tracción, con la factura de GPU como causa raíz.
Desarrollo guiado por evaluación
Arma un dataset golden en la primera semana y trátalo como contrato: todo cambio de prompt, modelo o pipeline corre la suite antes de subir. El portón de regresión en el CI pesca degradaciones que la revisión humana erra. Una feature de IA sin suite de eval es una apuesta pagada con la tarjeta del cliente.
Lo que los inversionistas preguntan ahora
La demo impresiona por cinco minutos; la metodología de eval y la estructura de margen sostienen la due diligence. Prepara respuestas defendibles: cobertura de la suite de evaluación, tasa de regresión capturada, costo de inferencia por usuario y trayectoria de margen por plan. La ronda B ya trata esos números como criterio de eliminación.
Rituales que sostienen la calidad
Revisión de eval cada semana con el equipo completo, postmortem de incidente cubriendo falla de modelo igual que cubriría falla de código, y cambio de prompt pasando por revisión igual que pasa el cambio de código. El prompt es código: versiona, prueba, audita. El equipo que sigue estos tres rituales detecta la regresión en horas, antes del primer llamado de cliente.