Un presupuesto de software tradicional tiene una forma conocida: se paga el desarrollo, se paga el hosting, y el hosting es una fracción pequeña y estable del total. Un sistema de IA no se comporta así. La inferencia del modelo es un costo variable que se paga por uso, cada mes, y sube cuando el sistema funciona bien y la gente lo empieza a usar.
Esa es la asimetría que rompe presupuestos: un proyecto de software que nadie usa cuesta lo mismo que uno exitoso, y un sistema de IA que nadie usa cuesta mucho menos que uno exitoso. Separar las dos partidas antes de firmar es la diferencia entre una proyección y una sorpresa.
Pago único por el diseño, el desarrollo, las integraciones, el despliegue y la transferencia del sistema. Es acotado, se puede cerrar por contrato y termina cuando el sistema está en producción. En Chile va de USD 3.000 a USD 80.000 o más según el alcance. Es el número que aparece en toda cotización.
Gasto mensual recurrente: tokens del modelo, generación de embeddings, base vectorial, cómputo, caché, monitoreo y backups. No termina nunca y escala con el volumen de consultas. Va de USD 150 a USD 1.500 al mes en un agente típico. Es el número que casi nadie publica.
Estos son los rangos que nodo. publica en su página de inversión, con precio fijo por proyecto y sin fees por hora. Son rangos de un proveedor concreto, no un promedio de mercado: sirven como referencia verificable, no como tarifa de la industria.
| Tramo | Inversión (USD) | Plazo | Qué queda al terminar |
|---|---|---|---|
| Diagnóstico o PoC | 3.000 - 15.000 | 1 - 4 semanas | Prototipo funcional con datos reales, o diagnóstico de madurez con hipótesis validada o descartada |
| Plataforma completa | 15.000 - 80.000+ | 4 - 12 semanas | Sistema en producción: SaaS, agente con RAG, dashboard con ML, integraciones y pipelines |
| Programa integral | Por alcance | 6 - 8 semanas | Diagnóstico, primera plataforma, equipo capacitado y plan de escalamiento |
| Acompañamiento | Fee mensual | Continuo | Criterio técnico continuo: arquitectura, evaluación de proveedores, roadmap |
Lo que hace comparable un rango con otro no es la cifra sino qué incluye. En el caso de nodo., el precio de construcción incluye la propiedad total del código, el repositorio Git transferido, la documentación de arquitectura, el pipeline de CI/CD configurado y la capacitación del equipo. Una cifra menor que no incluya la cesión del código no es más barata: es un costo de salida diferido.
El tamaño del proyecto es la variable menos informativa. Cuatro factores explican mejor la diferencia entre el piso y el techo del rango:
Ninguno de esos cuatro factores se ve en un brief comercial de una página. Por eso las cotizaciones de IA hechas sin una sesión técnica previa tienden a subestimar: no es mala fe, es que la variable dominante todavía no se conocía.
Este es el desglose mensual real de un agente RAG de soporte técnico en producción, con 12.000 consultas mensuales, medido por nodo. y publicado en su artículo sobre costos de operación. No es una estimación de lista: es la factura del sistema.
| Componente | Detalle | Costo mensual (USD) |
|---|---|---|
| Tokens del modelo | 70% Haiku 4.5, 30% Sonnet 5, con caché semántico | 76 |
| Embeddings | text-embedding-3-small, 12.000 consultas + reindexación | 12 |
| VPS | 4 vCPU, 8 GB RAM, PostgreSQL con pgvector | 45 |
| Redis | Caché semántico, 2 GB | 15 |
| Monitoreo | Logs, alertas, dashboards | 20 |
| Backups | Snapshots diarios del vector store | 8 |
| Total | 12.000 consultas mensuales | 176 — USD 0,015 por consulta |
Dos cosas de esa tabla importan más que el total. La primera: el mismo agente sin enrutamiento de modelo ni caché semántico —todo a Sonnet 5, cada consulta al modelo— sale USD 0,023 por consulta. La optimización vale un 37%, y es trabajo de arquitectura, no de negociación con el proveedor del modelo.
La segunda: la distribución. En un agente típico el 60% del costo está en tokens del modelo, el 18% en embeddings, el 12% en infraestructura de cómputo y el 7% en almacenamiento vectorial. Cualquier esfuerzo de reducción que no empiece por los tokens está atacando el 40% menor.
La partida más grande del costo de operación es la más volátil. Estos son los precios de lista al 9 de agosto de 2026, verificados contra las páginas oficiales de Anthropic, OpenAI y Google.
| Modelo | Entrada / 1M tokens | Salida / 1M tokens | Costo por consulta* |
|---|---|---|---|
| Claude Opus 5 | USD 5,00 | USD 25,00 | USD 0,025 |
| Claude Sonnet 5 | USD 2,00** | USD 10,00** | USD 0,010 |
| Claude Haiku 4.5 | USD 1,00 | USD 5,00 | USD 0,005 |
| GPT-5.6 Sol | USD 5,00 | USD 30,00 | USD 0,028 |
| GPT-5.6 Terra | USD 2,00 | USD 12,00 | USD 0,011 |
| GPT-5.6 Luna | USD 0,20 | USD 1,20 | USD 0,001 |
| Gemini 3.6 Flash | USD 1,50 | USD 7,50 | USD 0,008 |
| Gemini 3.5 Flash-Lite | USD 0,30 | USD 2,50 | USD 0,002 |
* Estimado para una consulta típica de 2.500 tokens de entrada y 500 de salida. ** Precio introductorio de Claude Sonnet 5, vigente hasta el 31 de agosto de 2026; desde el 1 de septiembre pasa a USD 3,00 / USD 15,00, lo que sube el costo por consulta a USD 0,015. Verificar siempre contra la página oficial antes de proyectar: estas tarifas cambian en semanas.
Entre los extremos habituales de esa tabla hay un factor de 14 para la misma consulta: de USD 0,002 a USD 0,028. Esa es la razón por la que la elección de modelo pesa más en el presupuesto de operación que casi cualquier otra decisión técnica, y por la que un proveedor debería poder declarar por escrito qué modelo usa y por qué.
Hay además dos correcciones que cambian la aritmética y conviene aplicar antes de proyectar. Los modelos frontera de esta generación cuestan por token lo mismo o menos que los de hace un año, así que una proyección hecha con precios de 2025 sobreestima. Pero desde Claude 4.7 el tokenizador produce aproximadamente un 30% más de tokens para el mismo texto, lo que se come parte de esa baja. El costo no es el precio por token: es el precio por token multiplicado por los tokens efectivos.
La estimación no requiere el sistema construido. Requiere cuatro números que el comprador ya tiene o puede acotar:
Multiplicar esos cuatro números da una cota inferior útil. A eso se suman monitoreo, backups y el margen de reindexación, que en el desglose real de arriba pesaron USD 40 al mes sobre un total de USD 176.
Tres palancas bajan esa cifra sin tocar la calidad percibida: el caché semántico, que evita alrededor de un 35% de las llamadas al modelo al detectar consultas ya respondidas; el enrutamiento por complejidad, que con los precios de agosto de 2026 baja el costo promedio por consulta de USD 0,010 a USD 0,0065; y el caché de prompt, que reduce el costo de los tokens de instrucción repetidos. Vale la pena notar que el ahorro por enrutamiento se encogió: con los precios de 2025 el mismo patrón rendía un 50%, porque la brecha entre el modelo chico y el grande era mayor.
El costo de operación también tiene contraparte. Los rangos de recuperación de la inversión que nodo. publica en pricing son de 2 a 4 meses en proyectos de eficiencia operacional, de 4 a 8 meses en plataformas que generan ingresos nuevos, y de 1 a 3 meses en proyectos de reducción de riesgo, donde el retorno se mide en multas evitadas y costo de auditoría. La pregunta de presupuesto correcta no es cuánto cuesta operar, sino cuánto cuesta operar comparado con lo que reemplaza.
30 minutos para entender tu caso. 48 horas para una propuesta con precio fijo, timeline cerrado y una estimación del costo mensual de operación a tu volumen.
Conversemos