Convierte el control de costes de la programación con IA en una habilidad laboral
Trata el gasto en programación con IA como una restricción de ingeniería y muestra los ahorros en tu currículum.

La factura de tokens es una señal de contratación
Tu asistente de programación con IA puede agilizar una tarea, pero la factura de tokens recae sobre el presupuesto de ingeniería. Para 2028, se proyecta que los costes de la programación con IA superarán el salario medio de un desarrollador.
Una cuarta parte de los responsables de ingeniería ya gasta entre $200 y $500 por desarrollador al mes en tokens, y algunos gastan más de $2,000.
La señal de empleabilidad está en si tratas al asistente como una herramienta con presupuesto o como una sin límites. Una respuesta sólida es un flujo de trabajo que protege la calidad manteniendo el gasto bajo control. Demuestra que puedes razonar sobre el coste de la misma manera que lo haces con la latencia, la memoria o la cobertura de pruebas.
Una lista de verificación de cuatro pasos hace visibles los ahorros
Empieza por la tarea, no por el modelo. Decide qué ve el asistente principal, qué maneja un trabajador más económico y dónde debe detenerse una llamada. El patrón que puedes explicar en una entrevista es qué limitaste, qué delegaste, qué pusiste bajo tope y qué mediste.
El contexto es el recurso escaso. Un modelo que ve demasiado código irrelevante desperdicia tokens, se desvía y toma decisiones más débiles. Un modelo que ve el fragmento adecuado puede responder más rápido y con mayor fiabilidad. La delegación aplica la misma idea al trabajo: el asistente principal se encarga del razonamiento complejo, mientras que un trabajador más económico maneja las partes repetitivas. Haz explícito el compromiso, para que la siguiente persona pueda repetirlo sin adivinar.
- Establece un límite de tamaño de archivo. El hook check-file-size del plugin shunt bloquea las lecturas de Claude Code cuando un archivo supera un umbral de líneas configurable, con un valor predeterminado de 350 líneas. Haz visible el límite: si un archivo es demasiado grande, pide un resumen o un fragmento más estrecho en lugar de cargar el archivo completo en el contexto. Usa un plugin, un script o una convención de equipo. Un límite visible supera a uno memorizado, porque obliga al asistente a solicitar el contexto útil más pequeño.
- Delega las lecturas masivas. Enruta el escaneo repetitivo, el análisis de bajo riesgo o las lecturas masivas a un modelo de trabajador más económico. El flujo de trabajo se probó contra un monorepo Java, un único repositorio, en cuatro escenarios, y los ahorros medios de tokens en lecturas masivas fueron de aproximadamente 90 por ciento. Los ejemplos de delegación de Portal usaron Gemini 2.5 Flash como modelo de trabajador, y la configuración de modo acepta cualquier modelo configurado en la instancia de Portal. El trabajador debe devolver justo lo suficiente para la siguiente decisión: qué cambió, dónde está y qué necesita una inspección más cercana. Eso mantiene al asistente principal enfocado en la parte del problema que realmente necesita juicio.
- Pon tope al tiempo de invocación. Asigna un límite de tiempo estricto a las llamadas delegadas. Las respuestas de delegación de Portal suelen llegar en 10 a 30 segundos, mientras que una llamada individual está limitada a 30 segundos. Divide las generaciones grandes en llamadas más pequeñas y trata un tiempo de espera agotado como una señal para reintentar con una solicitud más estrecha. Una llamada con tope es útil cuando devuelve un resultado parcial y te dice qué preguntar a continuación.
- Registra los ahorros. Guarda un número de antes y después para cada cambio de flujo de trabajo. Anota la tarea, el límite de contexto, el modelo delegado, el tope de tiempo y la diferencia de tokens. La nota debe ser lo suficientemente específica para que un entrevistador pueda hacer una pregunta de seguimiento, y lo suficientemente honesta para que puedas responderla. Una línea breve lista para el currículum es una mejora medible, no una afirmación vaga sobre el uso de herramientas de IA.
La métrica queda lista para la entrevista
Cuando presentes el flujo de trabajo, empieza por la restricción, no por la herramienta. Di que limitaste el contexto, delegaste lecturas repetitivas, pusiste tope al tiempo de invocación y mediste el resultado. Luego da el número que registraste. Si el número es pequeño, aun así demuestra que puedes instrumentar un proceso, comparar alternativas y tomar un compromiso.
A los empleadores les importa ese hábito porque escala entre equipos, repositorios y presupuestos. El mismo flujo de trabajo puede aplicarse a un repositorio nuevo, un modelo nuevo o un objetivo de coste nuevo, y el número registrado te da una historia concreta en lugar de una afirmación genérica sobre IA.
Elige un repositorio, aplica la lista de verificación y escribe el número de antes y después en tu currículum esta semana.