Vocês pediram no canal e eu voltei a testar. Passei um mês e meio com o Codex dentro da minha operação, em Linux e em Mac. Com subagente, uma feature de tela nova fica horas executando — e mesmo assim eu não vou cancelar. Te explico exatamente onde ele me paga o que custa.
Resposta rápida: o Codex é muito lento quando eu mando executar com subagente — tarefa que não é grande, tipo uma feature ou uma tela nova, fica horas rodando. O motivo principal que eu identifiquei é o volume de teste unitário que ele escreve por conta própria, mesmo sem eu pedir: mandar desativar quebra o resultado, então não adianta. A qualidade dele é razoavelmente boa, de média para boa, as ideias de arquitetura ajudam de verdade, e ele consome relativamente pouco. Também bate rate limit rápido: com três, quatro máquinas minhas executando ao mesmo tempo, vem erro de API. Onde ele me ganha das outras é browser: super autônomo, abre, loga e testa sem ficar pedindo autorização — é a minha melhor ferramenta pra teste ponta a ponta visual, inclusive com o meu login de produção já aberto. Por isso ele fica: não como ferramenta única, mas como segunda opinião antes de eu subir coisa crítica.
Gravei esses 6 minutos e pouco no canal @josimarjmv em 4 de julho de 2026, reto, sem corte. Assista e leia junto: aqui embaixo eu fui atrás da documentação oficial do Codex pra responder a pergunta que eu mesmo fiz no fim da gravação — tem como deixar isso mais rápido? — e o que eu achei explica o meu erro melhor do que eu expliquei.
🎧 PREFERE OUVIR? · 7 min
Este artigo também é um episódio do podcast Josimar JMV | Em Produção — o mesmo vídeo, só o áudio, normalizado pra fone.
Antes de eu falar mal da velocidade da ferramenta dos outros, a minha carteirada. Eu sou CEO de uma empresa de tecnologia e tenho todas as IAs que você pensar contratadas nos planos cheios, justamente pra poder testar. Não é papagaio digital repetindo benchmark de rede social: eu boto a mão na massa, eu testo, e além de testar eu pago a conta no quinto dia útil.
Isso muda o tipo de conclusão que eu consigo te dar. Quem testa uma tarde acha bonito. Quem passa um mês e meio com a ferramenta no fluxo de trabalho real descobre onde ela trava. E eu voltei a testar o Codex porque vocês pediram — eu já tinha testado no ano passado, e o pedido veio do canal. Obrigado a quem pediu, porque esse teste rendeu decisão prática aqui dentro.
Pra você entender o peso da tarefa que eu dou pra essas ferramentas, tem que saber onde elas mexem. Eu tenho um sistema meu que chama Pangeia. Botei esse nome porque é tudo junto: é por ali que eu gerencio a minha infraestrutura. Fui automatizando e criando esse sistema ao longo do tempo pra que eu sozinho consiga gerenciar uma infra monstruosa que já teve cinco pessoas gerenciando. Hoje ele faz um tanto de coisa absurda, e eu mexo nele direto, melhorando e atualizando.
Então não é to-do list de tutorial. São às vezes regras pesadas de infraestrutura. É esse o terreno onde eu avalio se uma IA presta ou não presta — o mesmo terreno que eu descrevi quando contei por que eu migrei da nuvem pro on-premise e quando mostrei a conta de parar de pagar VM na nuvem.
O jeito que eu trabalho é sempre o mesmo, e nisso o Codex é bom: a gente vai lá, faz arquitetura, fala de infraestrutura, de processo, do job, de como vai fazer e como vai funcionar. Definimos todo o escopo da tarefa antes de escrever uma linha. E ele tem boas ideias de arquitetura, ajuda bastante nessa hora. Isso é mérito dele e eu faço questão de registrar, porque é a parte em que eu não tenho reclamação.
Aí vem a famosa pergunta: você quer que eu execute a tarefa direto, ou quer que eu execute com subagentes? E eu caio na bobeira de escolher subagente — porque eu não quero ficar conferindo tarefa a tarefa. Outra coisa que eu faço: só uso o modo com tudo liberado, permissão total. Esse negócio de ficar permitindo toda hora eu acho um saco, não tenho paciência. Então eu habilito tudo e pronto.
E antes que alguém me escreva dizendo que isso é irresponsável: o que não tem nessa máquina é login de banco e acesso à produção. Essas coisas ficam fora. Eu tenho até um episódio pra contar em vídeo sobre uma VPN que ficou conectada e um modelo atrevido que tentou chegar na minha produção — sem nenhum dado envolvido, e é pauta de outro vídeo. O que eu já escrevi sobre esse tipo de freio está em como um safeguard trava um pente-fino de segurança.
Aí eu deixo o Codex executar. E é aqui que mora a reclamação do título. Mesmo colocando aquela configuração de velocidade, com subagente ele é muito lento. Muito lento mesmo. Eu tenho que deixar rodando e esquecer, porque olhar não acelera.
O tamanho da lentidão: tem tarefa que fica horas. Uma feature, uma tela nova, literalmente horas executando. E não é uma coisa tão grande assim. Pra você ter a minha régua: se um Fable fica cinco horas executando pra fazer um sistema inteiro, tudo bem, isso é outro tamanho de trabalho. Agora horas pra uma feature? Aí não fecha.
E por que demora tanto? Ele faz muito teste. Mesmo se eu não pedir, ele escreve muito teste unitário da cabeça dele. O desenvolvimento orientado a teste é essencial no jeito dele trabalhar — e como ele faz muito, demora muito. Você até pode mandar desativar se não quiser, mas aí quebra. Então não é um botão que resolve: é o desenho da ferramenta.
Eu testei em Linux e testei em Mac. Nossa mãe. Mesmo comportamento. E eu fechei a gravação pedindo: se alguém tiver uma sugestão de ajuste, me manda, porque eu pesquisei, testei e me enchi.
Esta seção é apuração minha, feita em 28/09/2026, e não estava na gravação — eu prometi ir atrás e fui. Na documentação oficial do Codex sobre subagentes, tem uma frase que explica o meu tempo de parede: "because each subagent does its own model and tool work, subagent workflows consume more tokens than comparable single-agent runs". Ou seja: cada subagente roda o próprio ciclo de modelo e de ferramenta. Mais ciclo é mais token, e mais token é mais tempo.
E tem a recomendação de uso, que é onde eu levei a paulada: a própria documentação manda começar por tarefa de leitura — "read-heavy tasks such as exploration, tests, triage, and summarization" — e avisa pra ter mais cuidado com fluxo paralelo de escrita, porque "agents editing code at once can create conflicts and increase coordination overhead".
Agora repara no que eu fiz na gravação: eu mandei subagente construir uma feature. Isso é escrita pesada, o caso exato que a documentação pede pra evitar. Eu não estou passando pano pra lentidão — horas numa feature continua ruim, e a minha crítica fica de pé. Mas é honesto dizer que parte do tempo eu comprei escolhendo subagente pro tipo de tarefa errado, só pra não ter que conferir tarefa a tarefa.
Tem outro detalhe do meu jeito de trabalhar que pesa nessa conta: eu trabalho em paralelo, com vários trabalhos ao mesmo tempo, e uso mais de um equipamento simultaneamente, direto e reto. Quando eu coloco três, quatro máquinas executando processo ao mesmo tempo, ele dá erro de API, rate limit. Ponto. É um limite que eu encosto com frequência.
Apuração minha (28/09/2026): isso não é exclusividade minha. Tem um relato público no repositório do próprio Codex, de outro usuário, descrevendo que o gatilho é a quantidade de sessões simultâneas e não o volume do dia, e que acima de duas ou três chamadas paralelas as sessões passam a falhar com erro 429. O detalhe que me interessa: ele registra que um agente pai com três subagentes já conta como quatro sessões. Não é número oficial publicado por ninguém — é comportamento observado, o meu e o dele —, e eu marco como tal. Eu já tinha passado por aperto de limite parecido do outro lado da cerca, quando contei que duas assinaturas me saem mais baratas que token avulso.
Agora a parte boa, e é ela que segura a assinatura. Ele é mais autônomo em algumas coisas, e a questão de browser ele é muito bom. Super autônomo com navegador: não fica pedindo muita autorização, abre o browser, testa, faz. Eu gosto muito dele pra teste ponta a ponta, o teste visual e gráfico.
Me perguntaram como é que eu faço teste ponta a ponta. O teste em si é padrão, você pesquisa e acha. A minha diferença está numa mania: eu não gosto de teste headless. Em muitos testes, não em todos, eu gosto do visual mesmo — abre na minha máquina aqui, loga, testa, e eu vou acompanhando o fluxo. É bitolação minha, e eu assumo que é.
Só que tem um motivo prático embaixo da mania: às vezes eu preciso testar uma coisa em produção inteira depois que sobe. Eu quero testar com o meu login de produção daquele produto — e aí ele abre o meu browser já logado e faz o teste inteiro. Isso um teste headless com usuário de mentira não me entrega. Eu já tinha contado como esse tipo de automação encurta o funil quando escrevi que o QA virou gargalo porque a IA escreve mais rápido do que eu testo.
Então fica assim: não vou cancelar mais o meu Codex, vai ficar ativo por enquanto. Ele tem me ajudado bastante. Mas eu repito a frase que importa pra quem vai decidir uma assinatura: não dá pra usar só ele. Se você for usar só o Codex, tá no pau da goiaba com tarefa maior.
Ele fica por dois motivos concretos. O primeiro é o teste ponta a ponta, que eu já contei. O segundo é que ele é uma segunda opinião pra validar coisa que um Opus, um Claude ou um Fable pode ter feito. Antes de botar em produção, se é algo muito crítico — um planejamento de peso, por exemplo —, eu sempre colho mais de uma opinião, porque não dá pra confiar cego. Eu mexo com coisa pra caramba.
Hoje o meu pipeline é esse: vou fazer qualquer coisa séria, mando uma busca profunda no Codex, mando o Claude fazer também, e comparo — além, claro, da opinião da minha própria equipe, que continua sendo a que decide. Perplexity eu não uso muito, acho as coisas extremamente rasas; já usei lá atrás, hoje não uso mais. O Gemini eu uso às vezes, às vezes não, apesar de ter voltado a assinar o plano ultra — e não foi por causa do Antigravity, foi por produção de vídeo e outras coisas; eu explico isso em outro vídeo. Essa disciplina de nunca decidir com uma cabeça só é a mesma que eu descrevi em lançou modelo novo e o meu projeto desandou na hora.
Como eu terminei a gravação pedindo sugestão, é justo eu devolver o que eu mesmo achei depois. Apuração minha, 28/09/2026, na referência de configuração oficial do Codex: existe um ajuste chamado esforço de raciocínio (model_reasoning_effort), descrito como o "reasoning effort advertised by the selected model", com níveis low, medium, high, xhigh, max e ultra, variando conforme o modelo. Esse é o botão que mais mexe no tempo de resposta — quanto mais alto, mais o modelo pensa antes de responder.
Então o roteiro que eu vou seguir daqui pra frente, e que eu sugiro se você está no mesmo aperto, é curto:
Repara que nenhuma dessas quatro é "troque de ferramenta". É escolher a tarefa certa pra cada ferramenta, que é o trabalho que ninguém terceiriza. É por isso que eu digo que empresa agêntica de verdade não é a que assina tudo: é a que sabe onde cada coisa entra.
Eu gravei em 04/07/2026 e escrevi este texto em 28/09/2026 — são quase três meses de diferença, e eu prefiro te avisar a fingir que é tudo de hoje. Duas honestidades. A primeira: o que eu relato de lentidão, de rate limit e de teste unitário é o comportamento que eu vi naquele mês e meio, na versão que estava no ar em julho; ferramenta de IA muda toda semana, então confira na sua máquina antes de tomar decisão de assinatura pela minha experiência.
A segunda: eu voltei ao assunto depois. Em setembro eu testei os agentes de desktop e contei o resultado em testei Claude Cowork e Codex Desktop e voltei pro terminal — lá o veredito sobre a versão desktop foi bem mais duro que este daqui. São coisas diferentes: aqui eu falo do Codex no terminal, que é o que continua ativo na minha conta. E a parte de apuração — a documentação de subagentes, a referência de configuração e o relato de erro 429 — é minha, de 28/09/2026, não estava na gravação e está marcada como tal no texto.
TODA SEGUNDA · MEIO-DIA · AO VIVO
Discorda? Concorda? Tem um caso parecido? Aqui não tem caixa de comentário de propósito: segunda-feira, ao meio-dia, eu faço live no canal e a gente conversa sobre isso ao vivo — sem corte, como sempre.
Resumindo o que eu levaria disso pra dentro da sua operação: Codex Tartaruga Ninja, estamos aí — ele fica na minha conta, mas fica no lugar certo. Antes de assinar ou cancelar qualquer IA, faça o que eu fiz: bote ela no seu fluxo real por semanas, anote onde ela trava e onde ela te ganha, e só então decida. Se você quer aprender a montar essa estrutura de verdade — infraestrutura, um SaaS em produção sem quebrar no caminho, agência de sites ou chatbot —, é disso que eu trato nas minhas imersões, e valor, data e condição ficam na página de cada uma, que é onde essa informação está certa. Eu também expliquei o que cada uma resolve e pra quem cada uma não serve. Um abraço, e até a próxima.
Baseado na gravação do canal @josimarjmv publicada em 04/07/2026 (6min46), com transcrição própria das legendas do próprio vídeo. São da minha vivência e foram ditos na gravação: ter voltado a testar o Codex a pedido do público do canal, depois de já ter testado no ano anterior; a experiência recente do último mês e meio a dois meses; ser CEO de uma empresa de tecnologia, ter todas as IAs contratadas nos planos cheios para testar, pôr a mão na massa e pagar a conta no quinto dia útil; o subagente do Codex ser muito lento mesmo com a configuração de velocidade, ao ponto de ter que deixar rodando e esquecer; pedir sugestão de ajuste porque já pesquisou, testou e se encheu; a qualidade ser razoavelmente boa, de média para boa; ter testado em Linux e em Mac; ele ter boas ideias de arquitetura e ajudar bastante; o sistema próprio chamado Pangeia, com esse nome porque é tudo junto, por onde gerencia a infraestrutura, criado e automatizado ao longo do tempo para uma pessoa sozinha gerenciar uma infra monstruosa que já teve cinco pessoas gerenciando, com regras às vezes pesadas de infraestrutura; o fluxo de fazer arquitetura, falar de infraestrutura, processo e job e definir todo o escopo antes; a pergunta sobre executar a tarefa direto ou com subagentes e a escolha por subagente para não conferir tarefa a tarefa; usar o modo com permissão total por não ter paciência de autorizar a cada passo; a máquina não ter login de banco nem acesso à produção; o episódio da VPN conectada em que um modelo tentou acessar a produção, sem nenhum dado envolvido, declarado como pauta de outro vídeo; o resultado ser bom e o consumo relativamente pouco, com plano grande contratado; trabalhar em paralelo, usar mais de um equipamento ao mesmo tempo e bater erro de API por rate limit com três ou quatro máquinas executando juntas; considerá-lo extremamente lento perto das outras; ser mais autônomo em algumas coisas e muito bom e super autônomo com browser, abrindo, testando e fazendo sem pedir muita autorização; gostar dele para teste ponta a ponta, visual e gráfico; não gostar de teste headless em muitos testes, mas não em todos, preferindo abrir na própria máquina, logar, testar e acompanhar o fluxo, e chamar isso de bitolação; precisar às vezes testar em produção inteira depois que sobe, com o próprio login de produção, abrindo o browser já logado para o teste inteiro; não ir mais cancelar o Codex e deixá-lo ativo por enquanto; não dar para usar só ele e ficar no pau da goiaba com tarefa maior; tarefa de feature ou tela nova ficar horas literalmente executando sem ser tão grande, e a comparação com cinco horas de um Fable para um sistema inteiro; o motivo ser o muito teste unitário que ele faz da cabeça dele mesmo sem pedido, com o desenvolvimento orientado a teste sendo essencial e desativar quebrando; ele servir como segunda opinião para validar o que um Opus, um Claude ou um Fable fez antes de produção em coisa muito crítica, como um planejamento; sempre colher mais de uma opinião além da própria equipe; o pipeline de mandar busca profunda no Codex e mandar o Claude fazer; não usar mais Perplexity por achar extremamente raso, tendo usado lá atrás; usar o Gemini às vezes, ter cancelado e voltado a contratar o plano ultra, com o motivo a explicar depois, não por causa do Antigravity e sim por produção de vídeo e outras coisas; e o fecho "Codex Tartaruga Ninja, estamos aí". É apuração minha, feita em 28/09/2026, e não estava na gravação: a documentação oficial do Codex sobre subagentes, com as frases "because each subagent does its own model and tool work, subagent workflows consume more tokens than comparable single-agent runs", a recomendação de começar por "read-heavy tasks such as exploration, tests, triage, and summarization" e o alerta de que "agents editing code at once can create conflicts and increase coordination overhead"; a referência de configuração oficial, com o model_reasoning_effort descrito como "reasoning effort advertised by the selected model" e os níveis low, medium, high, xhigh, max e ultra; e o relato público de erro 429 no repositório do Codex, aberto em 04/09/2026 por outro usuário, que atribui as falhas à quantidade de sessões simultâneas e registra que subagentes contam como sessão — relato de terceiro, não número oficial publicado, e está marcado assim no texto. A leitura de que parte da minha lentidão veio de eu ter escolhido subagente para tarefa de escrita é conclusão minha ao cruzar a gravação com a documentação. Sobre as minhas imersões eu não repito preço, data nem condição aqui: essa informação é final e fica na página de cada imersão.