Como construir um fluxo de trabalho no estilo Hermes Agent

(Esta é a segunda de uma série de três partes sobre o Agente Hermes e agentes similares. Parte 1 introduziu o problema dos limites de token e a defesa do contexto próprio. A Parte 3 abordará como colocar o Hermes Desktop em funcionamento – a configuração, as habilidades e os fluxos de trabalho.)

Encadear tarefas de IA – extrair um registro do Salesforce, verificar um data warehouse, elaborar um relatório – é um dos recursos mais poderosos que surgiram da atual onda de ferramentas de IA. Mas cada uma dessas ligações custa tokens, e uma única tarde de chamadas sérias para ferramentas pode custar uma assinatura de US$ 20. A solução é uma mudança arquitetônica: mover seus dados para fora do ecossistema do provedor e colocá-los no armazenamento que você controla.

O Hermes Agent de código aberto é uma implementação dessa abordagem. Ele usa três componentes para manter o contexto em sua infraestrutura e enviar ao modelo apenas as informações necessárias.

Um sistema com três partes

1: Um armazenamento de contexto local. Em vez de fazer com que todas as informações que sua IA toca passem pelo jardim murado de um provedor externo, você mantém os dados brutos no armazenamento que você controla – um banco de dados de equipe compartilhado, um data warehouse em nuvem como Snowflake ou BigQuery, até mesmo apenas uma pasta em armazenamento em nuvem compartilhado.

Quando o agente precisa de dados de um sistema comercial ativo – extraindo registros de conta do Salesforce por meio de uma conexão MCP, consultando segmentos de público de um CDP ou verificando o desempenho da campanha em seu data warehouse – ele faz a chamada e a resposta chega ao armazenamento de contexto antes que qualquer coisa chegue ao modelo. A loja se torna a única área de armazenamento para tudo o que a IA toca, quer os dados tenham chegado pré-carregados ou tenham sido obtidos recentemente. O LLM lê na loja e nunca chega diretamente ao seu CRM ou CDP.

2: Biblioteca de habilidades: contém guias de voz, regras de estilo, artigos anteriores e documentos de marca que sua IA utiliza para tom e contexto. Em vez de colar as mesmas diretrizes da marca em cada prompt, elas são armazenadas em um diretório local que o agente pode pesquisar. Quando uma nova tarefa chega, uma simples palavra-chave ou consulta vetorial — e não uma chamada LLM — encontra o trecho mais relevante e passa apenas esse trecho para o modelo. Isso custa centavos, independentemente do tamanho da sua biblioteca de referência. O modelo nunca vê o documento completo e você nunca paga para enviar toda a sua base de conhecimento através do medidor de tokens.

3: Um extrator de prompt mínimo. Esta é uma lógica simples – pontuação de palavras-chave, similaridade vetorial ou uma consulta direta ao banco de dados – que analisa a tarefa recebida, verifica o armazenamento de contexto em busca das informações mais relevantes e passa apenas essa fatia para o LLM. Quando a loja não possui os dados exigidos pela tarefa, o extrator pode acionar uma chamada MCP para seu CRM, uma solicitação de API para seu CDP ou uma consulta em seu data warehouse. Em seguida, a resposta chega ao armazenamento para ser processada como qualquer outro dado. O extrator não chama um LLM para nenhuma dessas etapas. Ele custa centavos, independentemente do volume.

A configuração dessa lógica de filtragem pode envolver um LLM uma vez, da mesma forma que você usaria um assistente de IA para escrever uma fórmula ou script. Mas, uma vez instalado, ele é executado automaticamente em cada lote de novos dados, sem chamar um modelo caro.

A forma como os dados se movem pelo sistema segue uma sequência consistente. Dados atualizados chegam de um CRM, CDP ou data warehouse e chegam ao armazenamento de contexto. Quando uma tarefa chega, o extrator verifica o armazenamento em busca das informações mais relevantes, extrai o trecho relevante e combina-o com o material de referência da biblioteca de habilidades. Somente esse pacote montado chega ao LLM. O modelo o processa e retorna um resultado, que é armazenado no armazenamento de contexto local. Cada etapa antes da chamada do modelo é executada sem incorrer em custos de token.

Uma mudança de mentalidade

A forma como isso acontece na prática começa a parecer menos uma implementação técnica e mais uma mudança na forma como você pensa sobre os fluxos de trabalho de IA.

A maioria dos profissionais de marketing aborda a IA da mesma forma que aborda um mecanismo de pesquisa: digite uma solicitação, obtenha um resultado e recomece na próxima vez. Esse é o modelo centrado no prompt. O prompt é o ponto de partida para tudo. Sua pergunta, a resposta do modelo, talvez um ou dois acompanhamentos – e então o contexto evapora na interface do provedor. Da próxima vez, quando precisar de algo semelhante, comece do zero. O modelo não aprende nada com o que veio antes.

O modelo estilo Hermes inverte esse hábito. O prompt se torna a etapa final, não a primeira. O verdadeiro trabalho acontece antes que o prompt seja escrito: os dados chegam ao armazenamento de contexto, o extrator encontra a fatia relevante e a biblioteca de habilidades fornece a voz e as regras. No momento em que o modelo vê alguma coisa, a questão já foi filtrada, montada e preparada. O trabalho do modelo se restringe a uma única tarefa de raciocínio: gerar o resultado usando dados que você já selecionou.

Essa mudança tem consequências que vão além da economia simbólica. Em um fluxo de trabalho centrado no prompt, o conhecimento institucional reside em conversas dispersas. Cada nova tarefa exige que alguém se lembre do que foi feito anteriormente e reconstrua manualmente o contexto. Num fluxo de trabalho centrado no contexto, a loja acumula tudo. Cada tarefa contribui para a próxima. Um briefing da marca escrito em janeiro serve como material de referência para um briefing de campanha em junho, para que ninguém precise vasculhar conversas antigas.

A mesma lógica se aplica à forma como as equipes trabalham juntas. Quando um novo coordenador de marketing entra no meio da campanha, ele não precisa percorrer semanas de histórico de bate-papo para entender a voz da marca, as definições de público e o posicionamento competitivo. Eles ficam na biblioteca de habilidades e no armazenamento de contexto. O novo membro da equipe pode começar a contribuir com um trabalho significativo desde o primeiro dia, porque o conhecimento acumulado pela equipe fica acessível ao agente — e, por meio dele, a ele.

É aqui que a arquitetura revela o seu real valor. A economia de tokens é imediata. Mas o efeito combinado de um sistema que aprende com cada interação é o que muda a forma como uma equipe opera ao longo do tempo.

Seus clientes pesquisam em qualquer lugar. Certifique-se de que sua marca aparece.

O kit de ferramentas de SEO que você conhece, além dos dados de visibilidade de IA de que você precisa.

Comece o teste gratuito
Comece com

Semrush One Logo

@media (largura máxima: 768px) { .headline-responsive { tamanho da fonte: 30px !importante; altura da linha: 1,3 !importante; } }

O Hermes Agent possui uma camada de memória que armazena preferências, correções e padrões recorrentes enquanto você trabalha. Quando você corrige o tom do agente em um rascunho, essa correção é alimentada automaticamente em rascunhos futuros. Quando um fluxo de trabalho específico se mostra eficaz, o agente pode salvá-lo como uma habilidade — assim, da próxima vez que você enfrentar o mesmo tipo de tarefa, o material e o processo de referência já estarão em vigor. O sistema funciona melhor com você quanto mais você o utiliza, sem exigir que você documente tudo manualmente.

Antes de construir

Uma coisa que a arquitetura não resolve sozinha é a escolha do modelo. Enviar a mesma consulta para dois modelos diferentes pode produzir resultados dramaticamente diferentes, e a qualidade do seu resultado ainda depende muito de qual modelo está fazendo o raciocínio.

A vantagem de uma camada independente de provedor como o Hermes Agent é que você pode trocar modelos livremente – testar o mesmo pipeline em um modelo OpenRouter gratuito, um Anthropic pago ou um LLaMA auto-hospedado – sem rearquitetar nada. As economias do padrão são consistentes em todos os modelos. A qualidade não é, e vale a pena testar.

Há também um obstáculo organizacional: uma assinatura de US$ 20/mês só precisa de um cartão de crédito. O acesso à API geralmente requer aquisição, uma análise de segurança e alguém que seja o proprietário da conta variável. O modelo de assinatura persiste em parte porque é fácil comprar, mesmo quando fica mais caro com o tempo. As equipes que adotam essa abordagem devem orçamentar esse aumento organizacional juntamente com a configuração técnica.

Algumas equipes tentaram contornar os limites de assinatura encaminhando uma assinatura Antrópica por meio de um agente. A Anthropic reprimiu essa prática, aplicando termos no nível da API, independentemente de como o acesso é encapsulado. O modelo de preços do provedor não é um acidente que você pode contornar – é a estrutura pretendida do serviço. A única maneira de escapar do teto é mudar o que o modelo vê.

Colocando o padrão para funcionar

Gerando texto do anúncio

Um pipeline típico de gerador de texto de anúncio pode exigir cinco variações de título com base nas especificações do produto armazenadas em um sistema interno. Em uma configuração tradicional, você forneceria ao modelo a descrição completa do produto, diretrizes da marca, resumo da campanha e definição de público. Todo esse contexto percorre o LLM todas as vezes.

Com a abordagem estilo Hermes, o pipeline funciona de maneira diferente.

O agente extrai as especificações do produto da API interna e armazena o JSON bruto localmente. Uma consulta leve extrai os campos de alta prioridade – preço, principais recursos, público-alvo – no valor de aproximadamente 300 tokens. O guia de voz da marca fica na biblioteca de habilidades, não no prompt. O LLM recebe apenas as especificações extraídas e gera as variações do título. A resposta é armazenada localmente para a próxima etapa. A cópia final é enviada para o CMS. (Todas as estimativas de token são baseadas em métricas de tokenização padrão usadas em todo o setor.)

A conta de tokens para isso seria de aproximadamente 450 tokens, em comparação com bem mais de 1.000 para a abordagem de contexto completo. A qualidade da saída permanece a mesma, mas o custo é reduzido para mais da metade.

Escuta social em tempo real

Em um fluxo de trabalho de escuta social em tempo real, o agente pesquisa a API do X/Twitter em busca de menções a um conjunto de palavras-chave da marca a cada cinco minutos. Cada lote de tweets brutos é armazenado localmente. Uma vez por hora, o filtro de relevância é executado usando pontuação simples de palavras-chave nos tweets – sem envolvimento de LLM – e identifica as 20 postagens mais relevantes. Esses 20, cerca de 400 tokens no total, são passados ​​para o modelo para análise de sentimento e usados ​​para criar um resumo de cinco itens. O corpo dos dados brutos nunca toca o modelo.

O custo do token por hora cairia substancialmente – de cerca de 3.000 para cerca de 600 – e a produção permaneceria inalterada

Nenhum destes gasodutos requer obras significativas de infra-estrutura. O primeiro pode ser configurado em poucos minutos. Instale o pacote, crie um perfil de marketing, defina o modelo OpenRouter gratuito como padrão, habilite os conjuntos de ferramentas necessários e aponte a loja local para um diretório de sua escolha. Um único comando – algo como resumir o tweet principal de um feed – executará todo o loop e mostrará exatamente quantos tokens foram consumidos no processo.

O segundo pipeline requer um pouco mais de orquestração: um cron job ou tarefa agendada para o loop de pesquisa e um script leve para o filtro de relevância. Mas o padrão central – armazenar primeiro, extrair e depois chamar o modelo – é o mesmo. E como o agente é independente de provedor, você pode trocar o modelo subjacente do OpenRouter para uma instância auto-hospedada sem alterar a lógica do pipeline.

É a arquitetura, estúpido

É por isso que a arquitetura é mais importante do que qualquer ferramenta específica. O Hermes Agent facilita a adoção do padrão, mas o padrão em si é o que impulsiona a economia. Uma organização confortável com scripts Python e um banco de dados compartilhado poderia replicar a mesma abordagem sem adotar qualquer nova plataforma. O hábito de armazenar primeiro e extrair antes de chamar o modelo é o fundamental.

E esse hábito se aplica além dos dois exemplos aqui. Personalização dinâmica de conteúdo, enriquecimento de perfil de cliente, coleta de inteligência competitiva, análise de desempenho de campanha – qualquer fluxo de trabalho em que você esteja alimentando dados brutos diretamente em um prompt LLM é um candidato para esta abordagem. A economia começa no momento em que você para de tratar o modelo como a primeira parada para seus dados e passa a tratá-lo como a última.

Esta é a segunda de uma série de três partes sobre o Agente Hermes e agentes similares. Parte 1 introduziu o problema dos limites de token e a defesa do contexto próprio.

A postagem Como construir um fluxo de trabalho no estilo Hermes Agent apareceu pela primeira vez na MarTech.



Fonte ==> Istoé

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *