Hermes Agent no cuesta nada y es una de las piezas de software más caras que puedes ejecutar, y las dos afirmaciones son ciertas a la vez. El agente en sí tiene licencia MIT; las propias preguntas frecuentes de Nous Research dicen que «solo pagas por el uso de la API del LLM de tu proveedor elegido», y que los modelos locales son gratis de ejecutar. La factura viene de otro sitio: un agente no envía un mensaje y espera una respuesta. Planifica, llama a una herramienta, lee el resultado, llama a otra, y cada uno de esos pasos es una petición aparte a un modelo que cobra por token.

Las guías de costes publicadas este mes enumeran precios por token y un VPS, y ahí se quedan. Lo que se les escapa es la forma del gasto de un agente, que es lo que decide si tu mes cuesta tres dólares o cien. Este artículo es aritmética sobre las listas de precios oficiales y sobre una medición hecha por la comunidad de lo que Hermes envía realmente en cada petición; no es una prueba de laboratorio, y donde una cifra es una estimación, lo dice.

Software gratis, pensamiento con contador

Hay tres maneras de darle un modelo a Hermes, y tienen formas de coste distintas. La primera es traer tu propia clave de API. La documentación de proveedores enumera soporte directo para MiniMax, Anthropic, OpenAI, DeepSeek, Gemini y xAI, además de OpenRouter, que pone unos cuantos cientos de modelos detrás de una sola clave, y «cualquier servicio con una API compatible con OpenAI». Pagas el precio de lista de cada proveedor. Cambiar es un único comando hermes model, lo que importa más de lo que parece, porque significa que la lista de precios es un menú y no una decisión.

La segunda vía es Nous Portal, la suscripción de la propia empresa. El nivel gratuito te da solo modelos gratuitos. Plus cuesta 20 dólares al mes por 22 dólares de crédito, Super 100 dólares por 110, Ultra 200 dólares por 220, con topes de arrastre de 10, 50 y 100 dólares respectivamente y acceso a más de 200 modelos y herramientas alojadas. Es, en la práctica, una tarjeta prepago con un 10 por ciento de regalo y una mejora del límite de peticiones; los tokens de debajo siguen costando lo que cuestan.

La tercera vía es local. Apunta Hermes a Ollama en localhost:11434 y los tokens son gratis; la documentación indica que Ollama necesita una ventana de contexto de al menos 64.000 tokens para que Hermes funcione bien. La propia página de Hermes de Ollama sugiere Gemma 4 para razonamiento y código con unos 16 GB de memoria de vídeo y Qwen 3.6 con unos 24 GB. Eso es una tarjeta gráfica seria o un Mac bien equipado, y la electricidad es real: una estimación publicada sitúa una tarjeta de 450 vatios funcionando las 24 horas en unos 39 dólares al mes a las tarifas medias de Estados Unidos, y un Mac en menos de 3. Si has seguido nuestra configuración de LocalAI en Windows o el recorrido de Claude Code con Ollama, ya tienes la mayor parte de esta vía montada.

Hay una cuarta vía, a medias: el alojamiento gestionado. Hostinger vende una máquina Hermes preconfigurada a 5,99 dólares al mes en promoción, que se renueva a 11,99, con «créditos de IA preconfigurados», búsqueda web y emparejamiento con Telegram incluidos, pagado por adelantado. Elimina el paso de la clave de API, que para un usuario no técnico es la mayor parte de la fricción, a cambio de un saldo de crédito cuyo tamaño no elegiste. Nuestros consejos para usuarios no técnicos de Hermes cubren cómo es ese intercambio en el día a día.

La cifra que importa son las llamadas, no las palabras

La medición útil viene de un usuario de Hermes que instrumentó el agente y publicó los resultados como un issue en GitHub. Cada petición que hace Hermes lleva un preámbulo fijo de unos 13.900 tokens: aproximadamente 5.200 tokens de prompt del sistema y 8.800 tokens que describen las 31 herramientas que el modelo puede invocar. Suma la conversación en sí y una petición típica rondaba entre 17.000 y 23.000 tokens. En una sola tarde, tres sesiones hicieron 207 llamadas a la API y enviaron unos 3,9 millones de tokens de entrada. La medición se hizo en una versión antigua, la v0.6.0, y las compilaciones de septiembre actuales han cambiado el prompt, así que toma las cifras como orden de magnitud y no como el sobrecoste exacto.

De ahí se siguen dos cosas. La primera es que tu prompt no es el coste. Escribas doce palabras o doscientas, la petición que sale de la máquina está dominada por el mismo preámbulo, repetido cada vez que el agente piensa. La segunda es que el precio que importa no es el precio de entrada de cabecera sino el precio de entrada en caché, porque ese preámbulo es idéntico de una llamada a la siguiente y todos los grandes proveedores facturan ahora un prefijo repetido con un descuento importante, siempre que el prompt del sistema se mantenga estable entre llamadas. La propia página de consejos de Nous dice exactamente eso: mantén iguales los archivos de contexto y la memoria y «los mensajes siguientes de una sesión obtienen aciertos de caché que son significativamente más baratos».

Aquí está esa tarde medida, valorada a la lista actual de cada proveedor, primero como si nada estuviera en caché y después como si todo lo estuviera. La realidad está entre las dos columnas, más cerca de la segunda en una sesión bien llevada.

ModeloEntrada / 1MEntrada en caché / 1MSalida / 1M3,9M tokens de entrada, sin cachéLo mismo, todo en caché
MiniMax M3 (plataforma MiniMax)$0,30$0,06$1,20$1,17$0,23
MiniMax M3 (vía OpenRouter)$0,23$0,05$0,96$0,90$0,20
DeepSeek V4 Flash (vía OpenRouter)$0,04no listado$0,10$0,16—
GPT-5.6 Luna$0,20$0,02$1,20$0,78$0,08
Gemini 3.5 Flash-Lite$0,30$0,03$2,50$1,17$0,12
Claude Haiku 4.5$1,00$0,10$5,00$3,90$0,39
Claude Sonnet 5$2,00$0,20$10,00$7,80$0,78
Claude Opus 5$5,00$0,50$25,00$19,50$1,95

Los precios proceden de las páginas de precios de MiniMax, Anthropic, OpenAI y Google y de los listados de OpenRouter a 17 de septiembre de 2026. Los tokens de salida son aparte y menores: si cada una de esas 207 llamadas produjera 500 tokens de texto, serían unos 100.000 tokens de salida, que añaden 12 centavos en M3 y 2,50 dólares en Opus. La página de MiniMax sigue mostrando el precio estándar de M3 como un «50% de descuento permanente» sobre la tarifa de lanzamiento, y se aplica una tarifa superior a las peticiones con más de 512.000 tokens de entrada, algo a lo que una sesión de agente puede llegar si nunca la comprimes.

Multiplica por treinta y aparece el mes. Una tarde así cada día cuesta unos 35 dólares en MiniMax M3 sin caché y unos 7 con caché completa; en Claude Opus 5 son 585 y 59 dólares. Ese abanico es toda la respuesta a «cuánto cuesta Hermes»: la elección de modelo es un multiplicador de dieciséis veces entre M3 y Opus, y la caché es un divisor de cinco a diez veces, y el agente está en medio enviando el mismo preámbulo un par de cientos de veces por noche. La estimación pública de un desarrollador, de 1 a 3 dólares al día con DeepSeek o MiniMax frente a 50 a 130 dólares al día con uso intensivo de Opus, llega a la misma forma desde el otro lado.

Hermes trae las palancas para esto, y la mayoría están desactivadas por defecto. agent.max_turns, el número de iteraciones de llamadas a herramientas por turno, es ilimitado salvo que lo fijes. agent.budget_warning_ratio da un aviso único al llegar a una fracción de un presupuesto que defines tú. La compresión se activa al 50 por ciento del límite de contexto, y /compress la hace bajo demanda; /usage muestra lo que ha consumido una sesión. Los subagentes son la palanca silenciosa: ejecutan sus propias conversaciones y devuelven solo un resumen, así que un objetivo de investigación largo no tiene que arrastrar todo su historial en cada llamada. Las ideas de fondo son las mismas que en nuestro artículo sobre la degradación del contexto en agentes de IA; el ángulo del coste es el mismo problema con un precio puesto.

MiniMax M3, Claude, o una caja debajo del escritorio

Qué vía gana depende menos de la calidad del modelo que de cuántas veces al día se despierta el agente. ¿Cuántas se despertaría el tuyo? Un agente que responde un mensaje de Telegram unas cuantas veces al día es un objeto económico distinto de uno que se deja en un bucle /goal toda la noche, y el mismo modelo puede ser la opción barata para uno y la cara para el otro.

VíaInicialUso ligero (≈50 llamadas al día)Uso intensivo (≈500 llamadas al día)A qué renuncias
MiniMax M3, clave propia$0Bastante menos de 1 dólar al día; centavos con cachéUnos 3 dólares al día sin caché; menos de 1 con cachéUn proveedor fuera de los tres grandes; revisa las condiciones de datos
Claude Sonnet 5, clave propia$01 a 2 dólares al día; menos de 0,20 con cachéUnos 19 dólares al día sin caché; 2 con cachéEl precio; el razonamiento más fuerte por llamada
Nous Portal Plus20 dólares al mesCubierto por los 22 dólares de crédito con modelos baratosLos créditos se agotan; recarga o sube a SuperPagas un 10% menos que la lista, pero con tarjeta, no con grifo
Local (Ollama, GPU de 16–24 GB)La GPUSolo electricidadSolo electricidad; más lento por llamadaCalidad del modelo; la factura del hardware; tus tardes
Alojamiento gestionado5,99 a 11,99 dólares al mesCubierto por los créditos incluidosTecho de crédito; comprueba qué significa «incluido»Control sobre qué modelo y cuánto

Las cifras diarias son la aritmética de la primera tabla escalada por número de llamadas y redondeada; una «llamada» aquí es una petición que lleva la media aproximada de 19.000 tokens de la medición. No son lo que te van a facturar. Son lo que implican las listas de precios y la única medición disponible, que es lo máximo que alguien puede decir honestamente sin ejecutar tu carga de trabajo.

MiniMax M3 es la entrada interesante porque su precio de entrada en caché, seis centavos por millón, es lo que lo hace barato para agentes en concreto. Su precio de entrada sin caché es el mismo que el del modelo pequeño de Gemini y solo un poco superior al de GPT-5.6 Luna; la diferencia aparece a lo largo de una noche de preámbulos repetidos. La guía de Hermes y MiniMax M3 cubre el modelo en sí y la conexión en un solo comando; un detalle de la documentación de proveedores es que el modelo MiniMax por defecto de Hermes sigue apareciendo como M2.7, que la plataforma cobra a los mismos 0,30 y 1,20 dólares, así que cambiar a M3 es una línea de configuración y no una decisión de coste. El contexto de 1 millón de tokens es la otra razón por la que la gente los empareja, y también es el motivo para vigilar el límite del tramo de 512.000 tokens.

Claude es la apuesta contraria. Por llamada es la línea más cara de la tabla, y por llamada es también la que tiene más probabilidades de terminar una tarea de varios pasos en menos llamadas, cosa que la tabla no puede mostrar. Una sesión que necesita 40 llamadas de Opus para hacer lo que a M3 le lleva 120 no es dieciséis veces más cara; está más cerca de seis, y para algunos trabajos ese es el intercambio correcto. La postura honesta es que nadie fuera de tu propia salida de /usage conoce la proporción para tus tareas, lo que es un buen argumento para empezar con el modelo barato y tener a mano el comando de cambio. Los perfiles de Claude y DeepSeek tienen el detalle del lado del modelo.

Lo local es donde la cuestión del coste se convierte en una cuestión de propiedad. Ejecutas un modelo de 26.000 millones de parámetros en tu propia tarjeta, los tokens son gratis, los archivos de memoria y habilidades que Hermes acumula viven en ~/.hermes en un disco que puedes sostener en la mano, y ninguna lista de precios puede cambiar bajo tus pies. Lo que pagas es el hardware, un bucle más lento y un modelo que va una generación por detrás de los alojados en razonamiento difícil. Aquí hay una tensión que no se resuelve en un consejo: la vía gratuita es la que más cuesta al principio, y la vía con contador es aquella en la que otro es dueño de lo que hace listo al agente. Cuál de las dos te molesta más es una pregunta sobre ti, no sobre Hermes. Nuestra calculadora de costes de IA te permite poner tus propios recuentos de llamadas frente a los precios actuales, y la sección de despliegue de modelos del directorio enumera las herramientas de servicio para la vía local.

Nous Research, por su parte, captura valor en el Portal y, desde el verano, de los inversores: en julio se informó de que la empresa estaba levantando capital a una valoración de 1.500 millones de dólares gracias a un agente que regala. El software es gratis, el bucle de aprendizaje es tuyo, y el pensamiento lo mide quien sea dueño del modelo. Ese es el arreglo, y una vez que lo ves, la cifra mensual deja de ser una sorpresa.

Todo lo anterior es aritmética sobre listas de precios publicadas y una medición de la comunidad hecha en una versión anterior; las compilaciones actuales envían un preámbulo distinto, los proveedores cambian precios sin avisar, y la única cifra que es cierta para ti es la de tu propio informe de /usage.

Preguntas frecuentes

¿Hermes Agent es gratis?

El software sí, bajo licencia MIT, y las preguntas frecuentes de Nous Research dicen que solo pagas por el modelo que conectes. Los tokens son el coste. Conecta un modelo local mediante Ollama e incluso esos son gratis, al precio de una tarjeta gráfica con 16 a 24 GB de memoria y la electricidad para moverla. La guía de instalación recorre la elección de modelo del primer arranque.

¿Cuánto cuesta Hermes Agent al mes?

Con la única carga de trabajo medida, una tarde de unas 200 llamadas valorada a las listas de hoy, un mes de uso diario va desde unos 5 dólares con el modelo pequeño de DeepSeek y de 7 a 35 dólares con MiniMax M3, según la caché, hasta 59 a 585 dólares con Claude Opus 5. Un uso ligero, de un mensaje unas pocas veces al día, son centavos con los modelos baratos. Nous Portal empieza en 20 dólares al mes por 22 de crédito, y la máquina gestionada de Hostinger cuesta de 5,99 a 11,99 dólares al mes con créditos incluidos. La calculadora de costes de IA acepta tu propio recuento de llamadas.

¿Puedo ejecutar Hermes Agent gratis?

De tres maneras, cada una con su pega. Un modelo local mediante Ollama es gratis por token pero necesita el hardware. El nivel gratuito de Nous Portal da acceso solo a modelos gratuitos. OpenRouter lista un puñado de modelos a 0 dólares por token, con límites diarios de peticiones. Nuestra guía avanzada de LocalAI cubre la vía del hardware en profundidad, y la guía de seguridad merece leerse antes de que cualquier modelo gratuito tenga acceso a herramientas en tu máquina.

¿MiniMax M3 es más barato que Claude para Hermes?

Por token, con mucha diferencia: 0,30 dólares de entrada y 1,20 de salida en la plataforma MiniMax frente a 2 y 10 dólares de Claude Sonnet 5 y 5 y 25 dólares de Opus 5, y la tarifa de entrada en caché de M3, 0,06 dólares, es lo que abarata el preámbulo repetido del agente. Por tarea terminada la distancia se acorta si el modelo más fuerte necesita menos llamadas, algo que solo tu propio informe de uso puede mostrar. La guía de MiniMax M3 tiene el detalle del modelo y los pasos de conexión.

¿Hermes funciona con modelos locales?

Sí. La documentación de proveedores enumera Ollama, vLLM, llama.cpp, LM Studio y SGLang, y Ollama necesita una ventana de contexto de al menos 64.000 tokens. La propia página de Hermes de Ollama sugiere Gemma 4 con unos 16 GB de memoria de vídeo o Qwen 3.6 con unos 24 GB. Las herramientas de servicio para esa vía están en la sección de despliegue de modelos del directorio.