Eu estava com um projeto inteiro rodando dentro do modelo anterior, contextualizado, indo bem. Subiu a versão nova e acabou: tive que iniciar outra sessão, ler tudo de novo e recomeçar. Não foi a primeira vez, não foi uma empresa só — e, se você tem pipeline rodando sozinho, esse é o seu problema também.
Resposta rápida: toda vez que sai modelo novo, eu sinto o modelo antigo piorar — e dessa vez me custou um projeto contextualizado que eu tive que refazer do zero. Eu não tenho como provar o que acontece por dentro do fornecedor, então eu não afirmo intenção: eu conto o que aconteceu comigo, em mais de um fornecedor, e o que dá pra fazer a respeito. O que dá pra fazer é concreto: não rodar produção no aplicativo de chat e sim na API, com a versão travada; escolher fornecedor que publica a política de aposentadoria do modelo; ter um plano B testado, sem viver trocando de modelo por esporte. E o passo que eu decidi dar aqui: treinar e tunar modelo pequeno na minha própria infraestrutura, com os meus dados de operação, pra parar de depender de alguém subir versão no meio da minha madrugada.
Gravei esses 13 minutos no canal @josimarjmv em 17 de julho de 2026, com raiva, no dia em que o negócio desandou. Assista e leia junto: aqui embaixo eu conto a mesma coisa com mais calma, com o que eu fui conferir depois e com uma nota de cronologia no fim.
🎧 PREFERE OUVIR? · 13 min
Este artigo também é um episódio do podcast Josimar JMV | Em Produção — o mesmo vídeo, só o áudio, normalizado pra fone.
Vou dar a minha carteirada antes, senão isso aqui vira mais um texto de gente repetindo lançamento. Eu sou de uma empresa de tecnologia de verdade: coordeno o time de desenvolvimento e a parte de infraestrutura, e são milhões de views por dia no nosso CDN, no Brasil e nos Estados Unidos. Eu falo porque eu boto a mão na massa, não porque eu li.
E eu vou ser honesto com você numa coisa que eu já disse na gravação: eu não pesquisei antes de gravar. Aquilo foi desabafo de quem acabou de perder trabalho. O que eu fui conferir depois, com fonte e data, está marcado neste texto como apuração minha — o resto é a minha experiência, que é o que eu tenho pra oferecer e é o que papagaio de pirata não tem.
Deixa eu contar o caso do jeito que ele foi. Eu estava usando a versão anterior do modelo, rodando um projeto dentro dela, contextualizado — e quem trabalha assim sabe o que isso significa: o modelo já sabia o meu projeto, já tinha o histórico da conversa, já estava azeitado. De repente lançaram a versão nova.
Acabou. Acabou na hora. Eu mantive a versão antiga de propósito, justamente pra não perder o contexto, e mesmo assim desandou. Tive que iniciar outra sessão, ler tudo de novo e começar o negócio do zero. Isso não é "impressão", isso é dia de trabalho que virou pó — e, no meu caso, no quinto dia útil eu tenho que pagar a conta.
Detalhe importante do meu método, porque muita gente confunde: esses testes eu não faço com agente autônomo. Eu testo na mão. Quando o negócio azeita direitinho, aí sim eu coloco no agente autônomo pra rodar sozinho. Ou seja: o que desandou não foi um robô mal configurado. Fui eu, na mão, com o mesmo trabalho de sempre.
E tem a parte que já vinha antes disso: continua lento. Os agentes autônomos que você manda executar tarefa gastam três, quatro horas no que eu, na mão, faria em uma hora e meia, duas. Isso, olha bem, é esperado e é normal — um dev sênior que conhece o projeto e sabe exatamente o que fazer numa feature é mais rápido do que qualquer um desses agentes. Não é crítica, é calibragem de expectativa. Nem toda IA é igual nesse quesito, aliás: tem ferramenta que entrega muito mais rápido que outra, e eu já escrevi sobre uma que não serviu pro meu pipeline autônomo.
A minha implicância tem nome e tem precedente. Lançava iPhone novo e o antigo dava uma depreciada — bateria começando a dar pau, aplicativo travando. A gente sabe como funciona esse ciclo de vida de produto em empresa grande, e é exatamente essa a sensação que eu tenho com IA: sobe a versão nova, a anterior emburrece.
Apuração minha (22/09/2026), porque eu falei isso de memória na gravação: o caso do iPhone é real e está documentado. A Apple admitiu que reduzia o desempenho de aparelhos com bateria degradada, disse que era pra evitar desligamento inesperado — não obsolescência programada —, se desculpou publicamente em dezembro de 2017 e baixou o preço da troca de bateria para 29 dólares. Depois disso, em novembro de 2020, fechou um acordo de 113 milhões de dólares com mais de trinta procuradorias estaduais nos Estados Unidos. Repare no que isso ensina: a parte de "reduzir o desempenho do antigo" foi admitida; a parte da intenção foi negada e virou processo. É o mesmo lugar onde eu estou com IA — eu sinto a queda, eu não tenho a intenção provada, e eu prefiro dizer isso do que gritar "golpe" e ficar sem argumento.
Se fosse um fornecedor só, era azar. Não é.
O que me tira do sério não é a versão nova existir. É não ter versionamento de verdade pra quem depende do que já estava rodando. Numa analogia de desenvolvedor: "vamos travar a versão pra, quando subir a nova, não avacalhar a antiga". Parece óbvio, né? Pois é.
Se fosse só eu perdendo uma tarde, tudo bem. O problema é maior, e é aqui que eu quero que você preste atenção.
Pensa numa empresa que fez o dever de casa: tem pipeline rodando bonitinho, agente autônomo trabalhando, tudo validado, tudo azeitado. Eles atualizam o modelo. Ferro. O seu pipeline não pediu upgrade, não aprovou mudança, não testou nada — e mesmo assim o chão mudou embaixo dele. Você descobre pelo resultado errado, não pelo aviso.
E aí cai no que eu sempre falo sobre dependência de um fornecedor só. O pessoal responde na hora: "tem que ter estratégia de harness, troca aqui, troca ali". OK, é válido, faz sentido — principalmente nesses casos. Mas eu vou colocar o outro lado, que ninguém coloca: também não dá pra ficar trocando o negócio toda hora. Cada troca é teste de novo, ajuste de novo, confiança construída de novo. Trocar é caro, só que é um custo que não aparece na fatura.
Por isso, pra mim, o harness bem feito é quando uma das pontas é local. Tipo: pego um modelo grandão pra análise, que muda quando eles quiserem, e um modelo local pra desenvolver, que só muda quando eu quiser. Aí eu tenho um chão que é meu.
Essa parte não estava na gravação — eu fui atrás depois, justamente porque reclamar sem saída não ajuda ninguém. São três coisas práticas, e as duas primeiras valem pra você usar amanhã de manhã.
1) Produção não roda no aplicativo de chat; roda na API, com a versão escolhida por você. É a diferença entre usar o produto de consumidor — onde o fornecedor troca o que está no ar quando quiser — e usar a interface de desenvolvedor, onde você aponta pro modelo que você testou. Foi exatamente por não ter isso que eu perdi a minha sessão: eu estava no lugar onde a decisão não é minha.
2) Antes de casar com um fornecedor, leia a política de aposentadoria dele. Tem quem publique isso de forma adulta: a Anthropic mantém uma página pública de aposentadoria de modelos, com o estado de cada um (ativo, descontinuado, aposentado), a data prevista de aposentadoria e o substituto recomendado — e o compromisso escrito de avisar quem está usando com pelo menos 60 dias de antecedência. Conferi essa página em 22/09/2026. Isso não impede o modelo de morrer um dia; impede ele de morrer de surpresa, que é o que quebra empresa.
Do outro lado, o precedente que sustenta a minha implicância. Em agosto de 2025, no lançamento do GPT-5, a OpenAI tirou os modelos anteriores do ChatGPT e teve que voltar atrás depois da reclamação, liberando os antigos pros assinantes pagantes. Depois, em 30 de janeiro de 2026, anunciou a aposentadoria do GPT-4o, do 4.1, do 4.1 mini e do o4-mini para o mês seguinte, com o argumento de que só 0,1% das pessoas usavam o 4o todo dia. Faz sentido pra quem administra capacidade de GPU. Só que, se você é o 0,1% e montou o seu negócio ali em cima, esse número não te consola — ele te desliga.
3) Tenha o plano B testado, não imaginado. Plano B que ninguém rodou não é plano, é esperança. Eu prefiro manter um segundo caminho rodando de vez em quando, mesmo custando um pouco mais caro, do que descobrir no dia do aperto. Isso é a mesma lógica de redundância que eu aplico em infraestrutura desde antes da pandemia — e é o motivo de eu ter migrado da nuvem pro on-premise quando a conta e o risco pararam de fechar.
Esse incômodo me levou longe. Eu comecei a pensar seriamente em treinar IA — e é treinar mesmo, não é figura de linguagem. Não pra competir com ninguém: pra treinar coisas internas, com muito menos token, resolvendo o que é útil pra minha empresa.
Dá trabalho? Dá muito trabalho e demora. Mas é um caminho que se consegue fazer quando você tem documento suficiente da sua operação pra treinar. E eu tenho: a gente mexe com software, tem histórico de git, tem documentação de Python, documentação de proxy, casos de uso e casos de não uso. Isso é matéria-prima de verdade.
O exemplo que eu dei na gravação é brasileiro e é bom: o iFood treinou uma IA interna deles. Pensa no tanto de dado que aquela operação gera o dia inteiro, gente comprando sem parar. Apuração minha (22/09/2026): o iFood desenvolveu um modelo próprio, treinado com dados internos da plataforma — busca, compra, cancelamento, avaliação — junto com a controladora, pra reduzir custo mantendo a performance. Ou seja: o meu raciocínio não é teoria, tem empresa grande fazendo exatamente isso no Brasil.
E olha a régua honesta, que é a parte que ninguém fala: não dá pra treinar quando você não tem nada. Se a sua operação não gera dado, não existe modelo interno pra treinar — existe assinatura pra pagar. O pré-requisito é o dado, e ele vem de operar, não de comprar curso.
Por isso eu digo que o meu próximo passo não é só instalar uma GPU grande e rodar um modelo aberto. É instalar a GPU grande, rodar o modelo aberto e tunar ele pra valer, com o que é meu. A infraestrutura pesada eu já tenho: já suporta a pancada, já está no Brasil. O que falta no meu pipeline hoje é exatamente essa peça — e é por isso que eu venho escrevendo que infraestrutura virou o novo superpoder na era da IA.
Agora a parte chata, que é a que decide se o plano sai do papel. Pra rodar modelo bala local, eu preciso de placa — e placa, no Brasil, é dor. A gente está tentando importar, mas está muito caro, o imposto é muito caro. E não é só preço: pra entrar em data center tem que ser tudo legalizado, com nota fiscal, do jeito certo. Não é comprar na promoção e enfiar no rack.
Some a isso o incentivo que não anda: cinco bilhões travados pra placa de vídeo em data center, que eu já detalhei em o texto sobre a isenção pra data center e GPU. Sinceramente? Eu não acredito que nada importante ande no Brasil antes da eleição. Eu prefiro planejar com a regra que existe hoje. O que me preocupa de verdade é a gente ter alguma soberania nacional de GPU e IA — e isso não se resolve com post no LinkedIn.
Sobre o hardware em si, dois pontos práticos que eu vivo respondendo:
O equipamento de treinamento de mesa. Aquele hardware que a NVIDIA trouxe pra treinamento estava saindo, na época da gravação, por algo entre cinquenta e noventa mil reais aqui no Brasil. É caro, mas é um começo possível pra quem vai treinar coisa interna. Apuração minha (22/09/2026): lá fora o DGX Spark foi lançado a 3.999 dólares, com 128 GB de memória unificada, e subiu pra 4.699 dólares em fevereiro de 2026 por causa do custo de memória. Faça a conta: a distância entre o preço de lá e o daqui é câmbio, imposto e importação. É exatamente o buraco que o incentivo travado deixou aberto.
A placa que estão tentando me empurrar. Vem gente me oferecendo T4 como se fosse placa de IA. No quesito que eu preciso, não serve. E aqui eu paro de falar de sensação e mostro a ficha: apuração minha (22/09/2026) na página oficial da própria NVIDIA — a T4 é arquitetura Turing, 16 GB de memória, 70 watts, posicionada pra inferência e transcodificação de vídeo. Ela é boa no que foi feita pra fazer. Ela não é placa de treinamento, e 16 GB não seguram modelo grande. Quem te vende T4 dizendo "é pra IA" ou não sabe, ou está te empurrando estoque parado.
E antes que pareça que eu virei as costas pra nuvem: não virei, eu só faço a conta. Quando você escala, pagar requisição e token não se sustenta — é caro, acredite em mim. Eu já mostrei essa matemática com o meu próprio bolso em por que duas assinaturas me saem mais baratas que pagar por token. Nuvem contra ambiente privado, no custo, é Davi contra Golias: não dá nem pra sair no empate. Óbvio que precisa de conhecimento de infraestrutura pra ter um negócio desse — e é aí que mora o trabalho de verdade.
Eu vendo imersão sobre infraestrutura, então desconte a minha propaganda de tudo que você leu. A minha queda de qualidade é percebida, não medida: eu não rodei benchmark antes e depois, eu senti no meu trabalho, num projeto meu, e é isso que eu estou te contando — quem quiser me contestar com número tem toda a razão de fazer isso. Parte do efeito pode ser meu: prompt que funcionava num modelo pode precisar de ajuste no outro, e trocar de sessão sempre perde contexto. Eu não tenho prova de intenção de ninguém — nem no caso do celular a intenção foi admitida, só a redução de desempenho. E o caminho do modelo local não é pra todo mundo: sem dado de operação e sem gente que saiba infraestrutura, treinar modelo interno é queimar dinheiro; nesse caso, pagar token e travar a versão é a decisão certa.
Este relato é do dia 17 de julho de 2026, quando eu gravei no susto, e eu não vou fingir que é de hoje. O que mudou até 22/09/2026: eu fui atrás do que eu tinha falado de cabeça e trouxe pra cá com fonte — o caso das baterias, a política de aposentadoria publicada de um fornecedor, o anúncio de aposentadoria dos modelos antigos de outro, o preço oficial do hardware de treinamento e a ficha técnica da placa que eu disse que não serve. O que não mudou: a decisão de puxar parte do trabalho pra dentro de casa. Fique de olho: preço de hardware, tabela de modelo e política de aposentadoria mudam rápido — confira a data antes de usar qualquer número daqui numa proposta.
TODA SEGUNDA · MEIO-DIA · AO VIVO
Discorda? Concorda? Tem um caso parecido? Aqui não tem caixa de comentário de propósito: segunda-feira, ao meio-dia, eu faço live no canal e a gente conversa sobre isso ao vivo — sem corte, como sempre.
Se você quer seguir esse caminho comigo — o de ter a sua própria nuvem privada, o seu hardware e o seu modelo, em vez de rezar pra ninguém mexer na versão —, é isso que eu abro na imersão presencial de infraestrutura, em São Paulo. Valor, data, vagas e condição ficam na página dela, que é onde essa informação vale e é atualizada. Eu vou entrar no fluxo completo: não é só saber desenvolvimento, não é só comprar servidor, não é só BGP e provedor, não é só pipeline — é saber qual hardware presta pra que dentro do data center. São milhões de reais que eu gastei estudando, quebrando cabeça e testando ao longo de vinte anos pra ter o nosso CDN. O objetivo de quem for é simples: não passar a raiva que eu passei.
Baseado na gravação do canal @josimarjmv publicada em 17/07/2026 (13min24), com transcrição própria das legendas do próprio vídeo. São da minha vivência e foram ditos na gravação: coordenar time de desenvolvimento e infraestrutura numa empresa de tecnologia com milhões de views por dia no CDN entre Brasil e Estados Unidos; ter gravado sem pesquisar, no calor do problema; estar com um projeto contextualizado no modelo anterior e ter perdido a sessão quando a versão nova subiu, tendo que ler tudo de novo; testar na mão antes de colocar no agente autônomo; os agentes gastando três a quatro horas no que eu faria em uma hora e meia a duas, e um dev sênior que conhece o projeto ser mais rápido que eles; a analogia do ciclo de vida do iPhone; sentir a mesma queda no Gemini e o problema na troca de modelo do DeepSeek, com o modelo de chat não servindo e a volta pro de raciocínio mais caro; não ter sentido isso na Anthropic, com o Opus 4.6 continuando a funcionar como antes no ambiente do Google, sem eu saber como são os acordos de infraestrutura entre as empresas; o risco pro pipeline autônomo quando o fornecedor atualiza o modelo; a ressalva de que estratégia de harness é válida mas trocar toda hora não dá, e que o harness bem feito tem uma ponta local; a decisão de treinar e tunar modelo pequeno com os dados da operação — repositórios, histórico de git, documentação, casos de uso e de não uso — e o exemplo do iFood; o custo e o imposto pra importar GPU, a exigência de nota fiscal pra entrar em data center e os cinco bilhões de incentivo travados; a faixa de cinquenta a noventa mil reais do equipamento de treinamento no Brasil; a T4 que me ofereceram não servir pro que eu preciso; e a conta de nuvem contra ambiente privado quando o negócio escala. É apuração minha, feita em 22/09/2026, e não estava na gravação: o desfecho documentado do caso das baterias — desculpa pública da Apple em dezembro de 2017, negando obsolescência programada, e o acordo de 113 milhões de dólares com mais de trinta procuradorias em novembro de 2020; a página pública de aposentadoria de modelos da Anthropic, com datas previstas e o compromisso de pelo menos 60 dias de aviso; a retirada dos modelos antigos do ChatGPT no lançamento do GPT-5 em agosto de 2025, com recuo depois, e o anúncio de 30/01/2026 aposentando GPT-4o, 4.1, 4.1 mini e o4-mini com o argumento dos 0,1% de uso diário; o modelo próprio do iFood treinado com dados internos; o preço oficial do DGX Spark a 3.999 dólares no lançamento, com aumento pra 4.699 dólares em fevereiro de 2026; e a ficha oficial da NVIDIA T4 — Turing, 16 GB, 70 W, posicionada pra inferência e transcodificação. Ressalva de honestidade: eu cito na gravação o valor e o número de vagas da minha imersão de infraestrutura, e como essa informação é final, muda a cada turma e foi dita em julho de 2026, aqui eu não repito nenhum desses números e mando pra página da imersão.