Eu criei um agente de voz em menos de um minuto, mandei ele ler o site de uma das plataformas da minha empresa e liguei pra ele pedindo preço de plano. Atendeu em tempo real, com voz boa, e foi buscar a informação na hora. O que quebrou não foi a inteligência — foi eu não conseguir interromper. E é exatamente aí que começa o assunto que quase ninguém quer encarar: o seu processo.
Resposta rápida: montar um agente de atendimento por voz com IA ficou fácil — eu fiz login, disse o que era a minha empresa, mandei ele ler o meu site e liguei pra ele, tudo em menos de um minuto, sem nenhum ajuste. Ele leu o site em tempo real durante a ligação e me respondeu a política de preço certinha. O que falhou foi conversa, não inteligência: começou a ler um texto de quinze linhas e não me deixou interromper — coisa que se trata no desenvolvimento, não na escolha da ferramenta. Então a pergunta certa não é "qual IA de voz eu contrato", é "a minha empresa tem processo escrito?". Se você não consegue treinar um colaborador novo porque nada está documentado, você não vai treinar uma IA que atende em tempo real. A ordem é: processo primeiro, um atendimento simples depois, validar, ajustar, avançar. E quando isso escala, o custo por chamada na nuvem vira o seu próximo problema — que é assunto de infraestrutura.
Gravei esses 14 minutos no canal @josimarjmv em 18 de julho de 2026, logo depois de fazer o teste. Assista e leia junto: aqui embaixo eu conto a mesma coisa com mais calma, com a tabela de preço que eu fui conferir depois e com uma nota de cronologia no fim.
🎧 PREFERE OUVIR? · 14 min
Este artigo também é um episódio do podcast Josimar JMV | Em Produção — o mesmo vídeo, só o áudio, normalizado pra fone.
Antes de qualquer coisa, a carteirada — senão isto vira só mais um texto de gente repetindo lançamento. Eu tenho uma empresa de tecnologia de verdade, com infraestrutura própria, e eu cuido de milhões de views por dia entre Brasil e Estados Unidos. Eu sou o dono, e mesmo assim boto a mão na massa: coordeno equipe e mexo com desenvolvimento todo dia.
Eu estou cansado de papagaio de pirata — o cara que pega uma notícia e traz pra você como se fosse experiência. O que eu trago aqui é o que eu testei, o que eu fiz e o que eu mexi. Se eu não tiver usado, eu não falo. Essa é a régua.
E eu não vou te vender a ideia de que eu já resolvi isso: eu ainda não tenho agente de voz atendendo o telefone da minha empresa. Estou desenvolvendo o meu, porque eu tenho infraestrutura pra isso. Este texto é o relato de quem está no meio do caminho, não de quem chegou.
A SpaceXAI lançou um construtor de agente de voz e eu fui testar. O que me chamou atenção não foi o modelo, foi o playground: a facilidade de montar a coisa. Entrei, fiz login com a minha conta do X, criei o bot, falei o que era a minha empresa, mandei ele ler o site e fiz uma ligação de teste. Eu não tinha gastado um minuto até ali.
Liguei e entrei como cliente mesmo: disse o meu nome e pedi os valores dos planos de hospedagem de vídeo. Ele me atendeu com uma voz muito boa, em tempo real, em linguagem natural. Perguntei qual era o diferencial, por que eu deveria contratar. E aí veio a parte que me interessou de verdade: ele falou "espera aí só um minutinho que eu vou ver as informações", foi ler o site na hora — eu vi o acesso no log — voltou e me entregou a resposta.
A resposta estava certa, inclusive na parte que é política de negócio: que a gente não cobra tráfego nem banda, diferente de plataformas que cobram, e que o que a gente cobra é espaço em disco e usuário simultâneo. Repare no detalhe: eu não fiz tuning nenhum, não montei base de conhecimento, não escrevi script. Ele leu a página e se virou.
Tem também o que me interessa como operador: o agente fala SIP. Dá pra plugar o telefone VoIP direto, contratando de uma operadora que já tem integração automática ou apontando o seu próprio SIP. Quem é de VoIP entendeu na hora o tamanho disso.
E antes que venha o "mas só tem essa": não. Dá pra fazer com ElevenLabs, dá pra fazer com a API de fala pra fala da OpenAI e com outras. Tem várias APIzinhas pra isso. A diferença aqui foi a facilidade de chegar num teste com telefone tocando.
Como hoje tem IA pra tudo, eu precisei de um método pra não perder a vida testando ferramenta. O meu é bruto de propósito: eu taco um teste básico, de qualquer jeito, sem nenhum ajuste. Se o resultado for pelo menos médio, aí eu dedico tempo pra testar de verdade. Se o resultado for muito ruim, eu nem mexo — falo "não vai dar" e não perco meu tempo.
Esse agente passou no meu crivo cru. Atender uma ligação, ler um site que ele nunca viu e responder política de preço sem eu ter configurado nada é bem acima de médio. Por isso este texto existe.
Agora o defeito, que é o mais instrutivo do teste. Sabe aquele texto de trinta linhas que um bot mal configurado te manda? Foi mais ou menos isso: ela começou a ler umas quinze linhas e eu tentei cortar — "não, já entendi, ok, mas eu quero saber outra coisa". Ela não deixou. Seguiu falando.
Isso é chato e é resolvível. Quando eu faço uma conversa com os modelos de voz em tempo real que já estão maduros, se ele me ouve falar, ele para. É ajuste de desenvolvimento, de pipeline, de workflow da ferramenta — não é limite da tecnologia. E é justamente a diferença entre brincar no playground e botar em produção.
Apuração minha, feita em 22/09/2026 e que não estava na gravação: a documentação do produto trata isso pelo nome — barge-in — e a recomendação oficial pra produção é ligar a detecção de voz no servidor (server_vad), pra que o agente pare de falar assim que a pessoa fala. Ou seja: o comportamento que me irritou no teste é uma chave que eu não liguei. Guarde isso, porque é o resumo de metade dos projetos de IA que dão errado por aí.
Esse tipo de ferramenta está sendo vendido caro. Eu vi gente cobrando em torno de sete mil reais por mês por um agente de prospecção que atende 24 por 7. Achei bem caro. E olha a conta simples: sete mil reais por mês é salário de dois, três SDRs — e SDR em geral é começo de carreira, o cara entra ali e depois evolui pra vendas. Quantas empresas você conhece que têm três SDRs? Quantas têm sete mil por mês só pra prospectar? Pouquíssimas.
Só que existe um segundo preço, e é o que morde depois. Se você tiver um, dois, três atendimentos por dia, não dói. O problema começa no uso da nuvem: quando você usa muito, fica caro pra caramba, porque a cobrança é por chamada, por minuto de conversa. O seu custo cresce junto com o seu sucesso, e é aí que o negócio deixa de fechar.
Apuração minha (22/09/2026): na tabela pública do produto que eu testei, o minuto de áudio do agente sai por US$ 0,08, mais US$ 0,01 por minuto de telefonia quando o número é provisionado por lá — e o construtor em si não cobra à parte. Faça a conta com o seu volume de ligações antes de prometer preço pro cliente; é isso que separa a proposta que dá lucro da que te quebra no terceiro mês.
Agora inverta o raciocínio, que é o que me interessa: e se você conseguisse, na sua própria infraestrutura, entregar uma solução dessas por uns dois mil reais por mês? Aí qualquer empresa pequena e média passa a ter atendimento por voz dentro do negócio. Só que precisa ser solução profissional — não é fazer um chat bobo e entregar. É a solução que resolve o problema, mata no peito e faz o gol.
Aí está o pulo do gato, e vale pra chat e pra voz. Não existe instalar um atendimento por IA no seu sistema do dia pra noite e ativar pra todo mundo. Eu vi muita gente entrar na onda de montar agente com ferramenta de automação visual e jogar em produção: se não for muito bem feito, não funciona no mercado real. Funciona pra vender curso sobre o assunto.
O jeito que funciona é degrau por degrau:
É assim que a gente desenvolve aqui. E não é papo de metodologia: é o único jeito que eu conheço de descobrir que a IA está errando antes que ela erre com trezentos clientes ao mesmo tempo. Eu já escrevi sobre o oposto disso, que é demitir a IA no primeiro dia de trabalho, quando ninguém demitiria um estagiário humano por errar na primeira semana.
Aqui está o motivo real de tanto projeto de IA morrer, e não tem nada a ver com modelo. Cada empresa tem o seu processo, o seu produto, o seu jeito de fazer, a sua forma de pagamento. Você não é igual ao seu vizinho. Tudo isso precisa ser treinado e ajustado na IA — e isso não é do dia pra noite.
Então me responde: quantas empresas você conhece que têm o pipeline de vendas e o de atendimento ao cliente escritos? Escritos de um jeito que, quando entra um colaborador novo, ele entende o fluxo inteiro, sabe o valor que precisa entregar e consegue fazer o trabalho pelo qual foi contratado?
E quantos colegas seus já falaram isso: "entrei na empresa, fiquei uma semana sem fazer nada, ninguém me ensinou, me jogaram lá e mandaram fazer". Eu faço entrevista de emprego aqui e o que eu ouço disso é mato. Você também já ouviu demais.
Pois é. Se a empresa não tem processo claro pra treinar um humano, que pergunta, que erra devagar e que aprende no corredor, você acha mesmo que ela tem processo claro pra treinar uma IA que atende em tempo real, onde tudo precisa estar muito mais condensado e explícito? Não tem.
Por isso, antes de mexer com IA, a gente apaga isso e começa na base: implantar os processos na empresa. Isso é gestão, não é tecnologia — e é a parte que ninguém quer fazer porque não rende post. Eu já contei aqui como a automação com IA não me deu tempo livre do jeito que prometiam: ela devolve tempo onde existe processo, e só onde existe processo.
Eu não falo isso de fora. Eu botei um chatbot pra rodar 24 horas por dia e ele atendeu 2.500 pessoas em uma semana, em produção, com lead real, sem jogar ninguém fora, atendimento certinho dentro do script. Isso não é demonstração: é gente do outro lado, com consequência comercial.
Agora imagina isso em atendimento por voz. É a mesma escala que eu chego. A diferença é que a voz pega a ponta onde a pessoa ainda liga pro telefone e quer falar com alguém — e "alguém" está prestes a mudar de significado. Eu abri a minha operação por dentro em empresa agêntica de verdade ou dinheiro de Monopoly, com os números do que já roda sozinho aqui.
A conclusão prática é dura pra quem vende ferramenta e boa pra quem opera: a parte fácil ficou fácil pra todo mundo ao mesmo tempo. Montar o agente é minuto. O que te diferencia é o processo por trás dele e o custo por trás da chamada.
Junta as duas pontas: a ferramenta ficou fácil e o custo por chamada cresce com o uso. Pra você comercializar isso no Brasil, num preço viável pra pequena e média empresa, a conta precisa fechar em algum lugar — e o lugar é a infraestrutura.
Se você atende só cliente high ticket, grande corporação, banco, tudo bem: o cara tem dinheiro, você resolve o problema dele e ele paga o preço que você colocar. Mas se você atende pequeno e médio, você briga no preço. Não tem para onde correr.
E aqui eu falo com a cicatriz: se eu não tivesse montado a minha infraestrutura, eu tinha quebrado. Eu não ia conseguir concorrer com os grandes. Eu comecei a montar isso antes da pandemia e é o que me mantém em pé até hoje. Quando eu digo infraestrutura não é "comprar servidor": é contratação, bloco de IP, sistema de deploy, redundância e georredundância, DNS, proxy, pipeline, contêiner, ambiente de sandbox e staging. Eu contei a virada inteira em migrei da nuvem pro on-premise e isso salvou a empresa, e por que infraestrutura virou o novo superpoder na era da IA.
É esse o conteúdo que eu levo pras imersões — a de chatbot e automação, onde entra o pipeline do atendimento com IA que eu rodo, e a presencial de infraestrutura, em São Paulo, pra quem vai montar a base. Condição, data e valor de cada turma ficam na página delas, que é onde essa informação vale.
Este relato é do teste que eu fiz e gravei em 18 de julho de 2026, e eu não vou fingir que é de hoje. Duas coisas pra você calibrar. Primeira: na gravação eu mesmo digo que esqueci o nome exato da ferramenta e mando você pesquisar — fui atrás e o nome é Voice Agent Builder, da SpaceXAI, anunciado em beta no dia 1º de julho de 2026, poucos dias antes do meu teste. Segunda: isso é software em beta e tabela de nuvem; preço, limite e recurso mudam. Os valores que eu cito aqui eu conferi na documentação oficial em 22/09/2026 — confira de novo antes de fechar proposta com cliente, porque a conta é sua.
Eu vendo imersões sobre isso, então desconte a minha propaganda de tudo que você leu. O meu teste foi um teste, não uma avaliação: foi uma ligação, num playground, sem tuning, com o meu próprio site como base — não é benchmark, e outra pessoa pode ter resultado diferente com outro sotaque, outro ruído de linha e outro produto. A crítica da interrupção pode ser injusta: eu não liguei a configuração que existe pra isso, e descobri isso depois; o defeito era meu, não da ferramenta. Os sete mil reais por mês são o que eu vi no mercado, não uma pesquisa de preço — pode ter fornecedor bom e mais barato que eu não conheço. E eu posso estar exagerando na parte de processo: tem empresa desorganizada que ligou um bot simples, de FAQ, e melhorou a vida — o meu argumento vale pra quem quer botar IA no fluxo de venda e de atendimento inteiro, não pra quem quer responder horário de funcionamento.
TODA SEGUNDA · MEIO-DIA · AO VIVO
Discorda? Concorda? Tem um caso parecido? Aqui não tem caixa de comentário de propósito: segunda-feira, ao meio-dia, eu faço live no canal e a gente conversa sobre isso ao vivo — sem corte, como sempre.
Baseado na gravação do canal @josimarjmv publicada em 18/07/2026 (14min14), com transcrição própria das legendas do próprio vídeo. São da minha vivência e foram ditos na gravação: ter infraestrutura própria e cuidar de milhões de views por dia entre Brasil e Estados Unidos; ser dono que coordena equipe e mexe com desenvolvimento; a implicância com papagaio de pirata; o teste completo — login pela conta do X, criação do agente em menos de um minuto, o agente lendo o meu site em tempo real durante a ligação, a resposta certa sobre não cobrar tráfego e cobrar disco e usuário simultâneo; o suporte a SIP e a integração com operadora de VoIP; as alternativas ElevenLabs e a API de fala pra fala da OpenAI; o meu método de tacar um teste cru e só investir tempo se o resultado for pelo menos médio; a resposta de quinze linhas que eu não consegui interromper e o fato de isso se resolver no desenvolvimento; os cerca de sete mil reais por mês cobrados no mercado por agente de prospecção e a comparação com salário de SDR; o custo por chamada crescendo com o uso da nuvem; o raciocínio de entregar a solução por volta de dois mil reais por mês em infraestrutura própria; a crítica ao agente mal feito que só funciona pra vender curso; o passo a passo de subir um atendimento por vez, validando, ajustando e voltando um degrau quando dá errado; a pergunta sobre processo escrito e o relato recorrente de colaborador jogado na função sem ninguém ensinar; o meu chatbot que atendeu 2.500 pessoas em uma semana com lead real dentro do script; a diferença entre atender high ticket e brigar no preço com pequena e média empresa; e ter começado a montar a minha infraestrutura antes da pandemia, sem a qual eu teria quebrado. É apuração minha, feita em 22/09/2026, e não estava na gravação: o nome e a data do produto que eu testei — o Voice Agent Builder da SpaceXAI, anunciado em beta em 1º de julho de 2026, com telefonia e SIP, busca em documentos, ferramentas e MCP, guardrails e gravação de chamada; a recomendação oficial de ligar a detecção de voz no servidor para o barge-in; e a tabela de preço de US$ 0,08 por minuto de áudio mais US$ 0,01 por minuto de telefonia. Duas ressalvas de honestidade: eu cito na gravação valores e vagas das minhas imersões, e como essa informação é final, muda a cada turma e foi dita em julho de 2026, aqui eu não repito nenhum desses números e mando pra página de cada imersão; e o valor de dois mil reais por mês é um raciocínio meu de viabilidade pra você fazer a sua conta, não uma tabela de preço de ninguém.