O Hermes Agent não custa nada e é um dos softwares mais caros que você pode rodar, e as duas afirmações são verdadeiras ao mesmo tempo. O agente em si tem licença MIT; o próprio FAQ da Nous Research diz que você "paga apenas pelo uso da API do LLM do provedor escolhido", e que modelos locais são gratuitos para rodar. A conta vem de outro lugar: um agente não envia uma mensagem e espera uma resposta. Ele planeja, chama uma ferramenta, lê o resultado, chama outra, e cada um desses passos é uma requisição separada a um modelo que cobra por token.
Os guias de custo publicados neste mês listam preços por token e um VPS e param por aí. O que eles deixam passar é o formato do gasto de um agente, que é o que decide se o seu mês custa três dólares ou cem. Este texto é aritmética sobre as tabelas de preço oficiais e sobre uma medição feita pela comunidade do que o Hermes realmente envia a cada requisição; não é um teste de laboratório, e onde um número é estimativa, ele diz isso.
Software grátis, raciocínio com taxímetro
Há três maneiras de alimentar o Hermes com um modelo, e elas têm formatos de custo diferentes. A primeira é trazer sua própria chave de API. A documentação de provedores lista suporte direto a MiniMax, Anthropic, OpenAI, DeepSeek, Gemini e xAI, além do OpenRouter, que coloca algumas centenas de modelos atrás de uma única chave, e "qualquer serviço com uma API compatível com a OpenAI". Você paga o preço de tabela de cada provedor. Trocar é um único comando hermes model, o que importa mais do que parece, porque significa que a tabela de preços é um cardápio, não uma decisão.
A segunda rota é o Nous Portal, a assinatura da própria empresa. O nível gratuito dá acesso só a modelos gratuitos. O Plus custa US$ 20 por mês por US$ 22 de créditos, o Super US$ 100 por US$ 110, o Ultra US$ 200 por US$ 220, com tetos de acúmulo de US$ 10, 50 e 100 respectivamente e acesso a mais de 200 modelos e ferramentas hospedadas. É, na prática, um cartão pré-pago com 10 por cento de bônus e um limite de requisições maior; os tokens por baixo continuam custando o que custam.
A terceira rota é local. Aponte o Hermes para o Ollama em localhost:11434 e os tokens são gratuitos; a documentação observa que o Ollama precisa de uma janela de contexto de pelo menos 64.000 tokens para o Hermes funcionar direito. A própria página do Hermes no Ollama sugere o Gemma 4 para raciocínio e código com cerca de 16 GB de memória de vídeo e o Qwen 3.6 com cerca de 24 GB. Isso é uma placa de vídeo séria ou um Mac bem equipado, e a eletricidade é real: uma estimativa publicada coloca uma placa de 450 watts rodando 24 horas em cerca de US$ 39 por mês nas tarifas médias dos EUA, e um Mac em menos de US$ 3. Se você seguiu nossa configuração do LocalAI no Windows ou o passo a passo de Claude Code com Ollama, já tem a maior parte dessa rota montada.
Há uma quarta rota, pela metade: hospedagem gerenciada. A Hostinger vende uma máquina Hermes pré-configurada por US$ 5,99 mensais em promoção, renovando a US$ 11,99, com "créditos de IA pré-configurados", busca na web e pareamento com Telegram incluídos, pagos adiantado. Ela remove a etapa da chave de API, que para um usuário não técnico é a maior parte do atrito, ao custo de um saldo de créditos cujo tamanho você não escolheu. Nossas dicas para usuários não técnicos do Hermes cobrem como é essa troca no dia a dia.
O número que importa são as chamadas, não as palavras
A medição útil vem de um usuário do Hermes que instrumentou o agente e publicou os resultados como uma issue no GitHub. Toda requisição que o Hermes faz carrega um preâmbulo fixo de cerca de 13.900 tokens: aproximadamente 5.200 tokens de prompt do sistema e 8.800 tokens descrevendo as 31 ferramentas que o modelo pode chamar. Some a conversa em si e uma requisição típica ficava entre 17.000 e 23.000 tokens. Em uma noite, três sessões fizeram 207 chamadas à API e enviaram cerca de 3,9 milhões de tokens de entrada. A medição foi feita em uma versão mais antiga, a v0.6.0, e as builds de setembro atuais mudaram o prompt, então trate os números como ordem de grandeza e não como o custo fixo exato.
Duas coisas decorrem disso. A primeira é que seu prompt não é o custo. Quer você digite doze palavras ou duzentas, a requisição que sai da máquina é dominada pelo mesmo preâmbulo, repetido toda vez que o agente pensa. A segunda é que o preço que importa não é o preço de entrada de cabeçalho, mas o preço de entrada em cache, porque esse preâmbulo é idêntico de uma chamada para a seguinte e todos os grandes provedores agora cobram um prefixo repetido com um desconto forte, desde que o prompt do sistema fique estável entre as chamadas. A própria página de dicas da Nous diz exatamente isso: mantenha os arquivos de contexto e a memória iguais e "as mensagens seguintes de uma sessão recebem acertos de cache que são significativamente mais baratos".
Aqui está aquela noite medida, precificada na tabela atual de cada provedor, primeiro como se nada estivesse em cache e depois como se tudo estivesse. A realidade fica entre as duas colunas, mais perto da segunda em uma sessão bem conduzida.
| Modelo | Entrada / 1M | Entrada em cache / 1M | Saída / 1M | 3,9M tokens de entrada, sem cache | O mesmo, tudo em cache |
|---|---|---|---|---|---|
| MiniMax M3 (plataforma MiniMax) | US$ 0,30 | US$ 0,06 | US$ 1,20 | US$ 1,17 | US$ 0,23 |
| MiniMax M3 (via OpenRouter) | US$ 0,23 | US$ 0,05 | US$ 0,96 | US$ 0,90 | US$ 0,20 |
| DeepSeek V4 Flash (via OpenRouter) | US$ 0,04 | não listado | US$ 0,10 | US$ 0,16 | — |
| GPT-5.6 Luna | US$ 0,20 | US$ 0,02 | US$ 1,20 | US$ 0,78 | US$ 0,08 |
| Gemini 3.5 Flash-Lite | US$ 0,30 | US$ 0,03 | US$ 2,50 | US$ 1,17 | US$ 0,12 |
| Claude Haiku 4.5 | US$ 1,00 | US$ 0,10 | US$ 5,00 | US$ 3,90 | US$ 0,39 |
| Claude Sonnet 5 | US$ 2,00 | US$ 0,20 | US$ 10,00 | US$ 7,80 | US$ 0,78 |
| Claude Opus 5 | US$ 5,00 | US$ 0,50 | US$ 25,00 | US$ 19,50 | US$ 1,95 |
Os preços vêm das páginas de preços da MiniMax, da Anthropic, da OpenAI e do Google e das listagens do OpenRouter em 17 de setembro de 2026. Tokens de saída são à parte e menores: se cada uma daquelas 207 chamadas produzisse 500 tokens de texto, seriam cerca de 100.000 tokens de saída, o que acrescenta 12 centavos no M3 e US$ 2,50 no Opus. A página da MiniMax ainda mostra o preço padrão do M3 como um "50% de desconto permanente" sobre a tarifa de lançamento, e uma faixa mais cara se aplica a requisições com mais de 512.000 tokens de entrada, o que uma sessão de agente pode alcançar se você nunca a comprimir.
Multiplique por trinta e o mês aparece. Uma noite como essa todos os dias custa cerca de US$ 35 no MiniMax M3 sem cache e cerca de US$ 7 com cache completo; no Claude Opus 5 são US$ 585 e US$ 59. Essa amplitude é a resposta inteira para "quanto custa o Hermes": a escolha do modelo é um multiplicador de dezesseis vezes entre o M3 e o Opus, e o cache é um divisor de cinco a dez vezes, e o agente fica no meio enviando o mesmo preâmbulo algumas centenas de vezes por noite. A estimativa pública de um desenvolvedor, de US$ 1 a 3 por dia com DeepSeek ou MiniMax contra US$ 50 a 130 por dia com uso pesado do Opus, chega ao mesmo formato pelo outro lado.
O Hermes vem com as alavancas para isso, e a maioria está desligada por padrão. agent.max_turns, o número de iterações de chamadas a ferramentas por turno, é ilimitado a menos que você defina. agent.budget_warning_ratio dá um aviso único ao atingir uma fração de um orçamento definido por você. A compressão entra a 50 por cento do limite de contexto, e /compress faz isso sob demanda; /usage mostra o que uma sessão consumiu. Os subagentes são a alavanca silenciosa: eles rodam suas próprias conversas e devolvem só um resumo, então um objetivo de pesquisa longo não precisa arrastar todo o histórico em cada chamada. As ideias por trás disso são as mesmas do nosso texto sobre degradação de contexto em agentes de IA; o ângulo do custo é o mesmo problema com um preço colado.
MiniMax M3, Claude, ou uma caixa embaixo da mesa
Qual rota vence depende menos da qualidade do modelo do que de quantas vezes por dia o agente acorda. Quantas vezes o seu acordaria? Um agente que responde a uma mensagem no Telegram algumas vezes por dia é um objeto econômico diferente de um deixado em um loop /goal a noite toda, e o mesmo modelo pode ser a escolha barata para um e a cara para o outro.
| Rota | Inicial | Uso leve (≈50 chamadas por dia) | Uso pesado (≈500 chamadas por dia) | Do que você abre mão |
|---|---|---|---|---|
| MiniMax M3, chave própria | US$ 0 | Bem menos de US$ 1 por dia; centavos com cache | Cerca de US$ 3 por dia sem cache; menos de US$ 1 com cache | Um provedor fora dos três grandes; verifique os termos de dados |
| Claude Sonnet 5, chave própria | US$ 0 | US$ 1 a 2 por dia; menos de US$ 0,20 com cache | Cerca de US$ 19 por dia sem cache; US$ 2 com cache | O preço; o raciocínio mais forte por chamada |
| Nous Portal Plus | US$ 20 por mês | Coberto pelos US$ 22 de crédito com modelos baratos | Os créditos acabam; recarregue ou suba para o Super | Você paga 10% menos que a tabela, mas com cartão, não com torneira |
| Local (Ollama, GPU de 16–24 GB) | A GPU | Só eletricidade | Só eletricidade; mais lento por chamada | Qualidade do modelo; a conta do hardware; suas noites |
| Hospedagem gerenciada | US$ 5,99 a 11,99 por mês | Coberto pelos créditos incluídos | Teto de créditos; confira o que "incluído" significa | Controle sobre qual modelo e quanto |
Os valores diários são a aritmética da primeira tabela escalada pelo número de chamadas e arredondada; uma "chamada" aqui é uma requisição carregando a média aproximada de 19.000 tokens da medição. Não são o que você vai ser cobrado. São o que as tabelas de preço e a única medição disponível implicam, que é o máximo que alguém pode dizer honestamente sem rodar a sua carga de trabalho.
O MiniMax M3 é a entrada interessante porque seu preço de entrada em cache, seis centavos por milhão, é o que o torna barato especificamente para agentes. Seu preço de entrada sem cache é o mesmo do modelo pequeno do Gemini e só um pouco acima do GPT-5.6 Luna; a diferença aparece ao longo de uma noite de preâmbulos repetidos. O guia de Hermes e MiniMax M3 cobre o modelo em si e a conexão em um único comando; um detalhe da documentação de provedores é que o modelo MiniMax padrão do Hermes ainda aparece como M2.7, que a plataforma cobra aos mesmos US$ 0,30 e 1,20, então trocar para o M3 é uma linha de configuração, não uma decisão de custo. O contexto de 1 milhão de tokens é a outra razão pela qual as pessoas juntam os dois, e também o motivo para ficar de olho na fronteira da faixa de 512.000 tokens.
O Claude é a aposta oposta. Por chamada é a linha mais cara da tabela, e por chamada é também a mais propensa a terminar uma tarefa de várias etapas em menos chamadas, o que a tabela não consegue mostrar. Uma sessão que precisa de 40 chamadas do Opus para fazer o que leva 120 chamadas do M3 não é dezesseis vezes mais cara; fica mais perto de seis, e para alguns trabalhos essa é a troca certa. A posição honesta é que ninguém fora da sua própria saída de /usage conhece a proporção para as suas tarefas, o que é um bom argumento para começar com o modelo barato e manter o comando de troca à mão. Os perfis do Claude e do DeepSeek têm o detalhe do lado do modelo.
Local é onde a questão do custo vira uma questão de propriedade. Você roda um modelo de 26 bilhões de parâmetros na sua própria placa, os tokens são gratuitos, os arquivos de memória e habilidades que o Hermes acumula ficam em ~/.hermes em um disco que você pode segurar na mão, e nenhuma tabela de preços pode mudar debaixo dos seus pés. O que você paga é o hardware, um loop mais lento e um modelo que está uma geração atrás dos hospedados em raciocínio difícil. Há uma tensão aqui que não se resolve em conselho: a rota gratuita é a que mais custa no início, e a rota com taxímetro é aquela em que outra pessoa é dona do que torna o agente inteligente. Qual das duas incomoda mais você é uma pergunta sobre você, não sobre o Hermes. Nossa calculadora de custo de IA permite colocar seus próprios números de chamadas contra os preços atuais, e a seção de implantação de modelos do diretório lista as ferramentas de serviço para a rota local.
A Nous Research, por sua vez, captura valor no Portal e, desde o verão, de investidores: em julho foi noticiado que a empresa estava captando a uma avaliação de US$ 1,5 bilhão com base em um agente que ela dá de graça. O software é gratuito, o loop de aprendizado é seu, e o raciocínio é medido por quem for dono do modelo. Esse é o arranjo, e depois que você consegue enxergá-lo, o número mensal deixa de ser surpresa.
Tudo acima é aritmética sobre tabelas de preço publicadas e uma medição da comunidade feita em uma versão anterior; as builds atuais enviam um preâmbulo diferente, os provedores mudam preços sem aviso, e o único número verdadeiro para você é o do seu próprio relatório de /usage.
Perguntas frequentes
O Hermes Agent é gratuito?
O software é, sob licença MIT, e o FAQ da Nous Research diz que você paga apenas pelo modelo que conectar. Os tokens são o custo. Conecte um modelo local pelo Ollama e até esses são gratuitos, ao preço de uma placa de vídeo com 16 a 24 GB de memória e da eletricidade para rodá-la. O guia de instalação percorre a escolha de modelo da primeira execução.
Quanto custa o Hermes Agent por mês?
Com a única carga de trabalho medida, uma noite de cerca de 200 chamadas precificada nas tabelas de hoje, um mês de uso diário vai de aproximadamente US$ 5 no modelo pequeno da DeepSeek e US$ 7 a 35 no MiniMax M3, dependendo do cache, até US$ 59 a 585 no Claude Opus 5. Uso leve, de uma mensagem algumas vezes por dia, são centavos nos modelos baratos. O Nous Portal começa em US$ 20 por mês por US$ 22 de crédito, e a máquina gerenciada da Hostinger custa de US$ 5,99 a 11,99 por mês com créditos incluídos. A calculadora de custo de IA aceita seu próprio número de chamadas.
Posso rodar o Hermes Agent de graça?
De três maneiras, cada uma com um porém. Um modelo local pelo Ollama é gratuito por token, mas precisa do hardware. O nível gratuito do Nous Portal dá acesso apenas a modelos gratuitos. O OpenRouter lista um punhado de modelos a US$ 0 por token, com limites diários de requisições. Nosso guia avançado do LocalAI cobre a rota do hardware em profundidade, e o guia de segurança vale a leitura antes que qualquer modelo gratuito tenha acesso a ferramentas na sua máquina.
O MiniMax M3 é mais barato que o Claude para o Hermes?
Por token, por uma margem larga: US$ 0,30 de entrada e US$ 1,20 de saída na plataforma MiniMax contra US$ 2 e 10 do Claude Sonnet 5 e US$ 5 e 25 do Opus 5, e a tarifa de entrada em cache do M3, US$ 0,06, é o que barateia o preâmbulo repetido do agente. Por tarefa concluída a distância diminui se o modelo mais forte precisar de menos chamadas, o que só o seu próprio relatório de uso pode mostrar. O guia do MiniMax M3 tem o detalhe do modelo e os passos de conexão.
O Hermes funciona com modelos locais?
Sim. A documentação de provedores lista Ollama, vLLM, llama.cpp, LM Studio e SGLang, com o Ollama precisando de uma janela de contexto de pelo menos 64.000 tokens. A própria página do Hermes no Ollama sugere o Gemma 4 com cerca de 16 GB de memória de vídeo ou o Qwen 3.6 com cerca de 24 GB. As ferramentas de serviço para essa rota estão na seção de implantação de modelos do diretório.