Notas

O efeito do marketing: a inteligência artificial generalizada

14 set 2026 · 3 min·read in EN

Quanto mais eu uso e comparo esses modelos, mais difícil fica separar progresso real de hype e marketing. A essa altura, me importo menos com promessas sobre AGI e mais com saber se a IA consegue realmente entregar resultados confiáveis sem consumir tempo, tokens e dinheiro demais.

Se você já ouviu falar em AGI (Artificial General Intelligence, ou Inteligência Artificial Geral), talvez isso já tenha te deixado ansioso em relação ao futuro — ou ao presente — em que estamos vivendo. Se nunca ouviu falar, bom, pode sair daqui. (Brincadeira.)

A verdade é que já ouvimos esse discurso várias vezes. Cada novo modelo está um passo mais perto da AGI. Cada novo modelo é o "melhor modelo para programação de todos os tempos" — disruptivo, impressionante, mais capaz do que qualquer coisa que veio antes.

O que eu vejo, porém, pelo menos nos meus projetos pessoais, é que os modelos mais novos estão se tornando cada vez mais consumidores de tokens.

Eu testei o GPT 6 Astra e a experiência foi extremamente frustrante. Fiz uma solicitação simples usando o nível Medium de esforço e, em cerca de uma hora, ele consumiu 50% da minha cota semanal — e nem sequer terminou o trabalho.

E aí temos os benchmarks.

Os números divulgados sempre mostram o novo modelo muito acima do seu antecessor e — sem deixar isso explícito demais — ligeiramente melhor do que o modelo mais recente e mais capaz do concorrente.

Eu não consigo entender como essa conta fecha.

A maioria de nós não tem métricas, recursos ou dinheiro suficientes para avaliar esses modelos de forma adequada por conta própria. Isso acaba deixando poucas opções, e uma das mais comuns é simplesmente fornecer o mesmo prompt para diferentes modelos e comparar os resultados.

Vejo muita gente tentando criar jogos, modelos 3D, animações e outros projetos usando modelos diferentes para compará-los entre si. Sempre achei isso curioso por um motivo específico: IA NÃO é determinística. Dê o mesmo prompt duas vezes para um modelo e você pode obter resultados diferentes. Mude um pouco o harness e você pode ter resultados significativamente melhores — ou piores.

Agora, isso não significa que essas comparações sejam inúteis.

O problema, para mim, é tratar uma única execução como se ela fosse suficiente para dizer qual modelo é melhor. Se você executasse exatamente a mesma tarefa 20, 30 ou 50 vezes, mantendo o harness e as configurações consistentes, e depois comparasse coisas como taxa de sucesso, custo, latência, consumo de tokens e quantas vezes o modelo realmente conseguiu concluir a tarefa, aí sim teríamos algo muito mais significativo.

Mas normalmente não é isso que vemos.

Em vez disso, alguém roda um prompt no Modelo A, consegue um resultado incrível, roda o mesmo prompt no Modelo B, consegue algo pior e, de repente, aparece um post dizendo que um modelo "destrói" o outro. Repita exatamente o mesmo experimento e a conclusão pode ser completamente diferente.

E isso faz parte do que torna tudo isso tão difícil de avaliar de fora.

O resultado não depende apenas do modelo. Depende também do prompt, do harness, das ferramentas disponíveis, do nível de esforço de raciocínio, do contexto e, às vezes, simplesmente da sorte naquela execução específica.

Por isso, para mim, é muito difícil conciliar tudo isso com a quantidade de posts que vemos nas redes sociais falando sobre AGI.

No fim das contas, cada vez mais fico com a sensação de que boa parte disso é simplesmente marketing.

IA é cara. Exige quantidades enormes de dinheiro e, eventualmente, os investidores querem saber o que estão recebendo em troca.

Se antes a palavra mais associada à IA era "hype", acho que ela está lentamente sendo substituída por outra:

ROI — retorno sobre o investimento.