<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Thiago Taranto</title><link>https://thiago.taranto.ai/</link><description>Recent content on Thiago Taranto</description><generator>Hugo</generator><language>pt-br</language><lastBuildDate>Thu, 30 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thiago.taranto.ai/index.xml" rel="self" type="application/rss+xml"/><item><title>Fronteira 'aberta' a um terço do custo: o Kimi K3 e a pressão sobre o seu contrato de IA</title><link>https://thiago.taranto.ai/decodes/2026/07/kimi-k3-fronteira-aberta/</link><pubDate>Thu, 30 Jul 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/decodes/2026/07/kimi-k3-fronteira-aberta/</guid><description>&lt;h2 id="1--o-que-o-paper-afirma"&gt;§1 — O que o paper afirma&lt;/h2&gt;
&lt;!-- Fatos do paper. Toda afirmação quantitativa DEVE citar seção/tabela do paper. --&gt;
&lt;p&gt;A Moonshot AI (time Kimi) apresenta o &lt;strong&gt;Kimi K3&lt;/strong&gt;, um modelo de linguagem
Mixture-of-Experts (MoE) — arquitetura em que só uma parte dos &amp;ldquo;especialistas&amp;rdquo;
internos é ativada por token, em vez do modelo inteiro — com visão nativa e
janela de contexto de &lt;strong&gt;1 milhão de tokens&lt;/strong&gt;. O modelo é descrito como o
&lt;strong&gt;primeiro modelo aberto de &amp;ldquo;classe 3 trilhões&amp;rdquo; de parâmetros&lt;/strong&gt; (Conclusão, §8).&lt;/p&gt;</description></item><item><title>A conta do 'rodar em casa' está errada: por que o custo real de inferência varia até 36×</title><link>https://thiago.taranto.ai/decodes/2026/07/custo-real-self-hosting/</link><pubDate>Sat, 04 Jul 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/decodes/2026/07/custo-real-self-hosting/</guid><description>&lt;h2 id="1--o-que-o-paper-afirma"&gt;§1 — O que o paper afirma&lt;/h2&gt;
&lt;p&gt;A pergunta que o paper ataca é a mais concreta que existe numa diretoria de tecnologia: &lt;em&gt;rodar o modelo na nossa própria infraestrutura sai mais barato do que pagar a API por token?&lt;/em&gt; A resposta que quase toda planilha dá está errada — e o erro tem uma causa única e mensurável.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;O erro está em assumir a GPU sempre cheia.&lt;/strong&gt; O autor levantou mais de 15 calculadoras públicas de custo de LLM (Helicone, LiteLLM, llm-prices.com e outras) e todas cometem o mesmo pecado: tratam a &lt;em&gt;ocupação&lt;/em&gt; da GPU (utilization) como um número que o usuário digita — ou assumem silenciosamente 100% (§2.1, §6.1). Ocupação não é uma entrada que você escolhe; é um &lt;em&gt;resultado&lt;/em&gt; de quanto tráfego chega. Uma GPU só fica cheia quando há requisições suficientes chegando ao mesmo tempo para preencher o lote de processamento. Com pouco tráfego, ela fica ociosa esperando — e você paga a hora de GPU inteira para processar um punhado de tokens.&lt;/p&gt;</description></item><item><title>A mesma GPU, 60–85% mais rápida por usuário: o ganho de inferência que não exige trocar de modelo</title><link>https://thiago.taranto.ai/decodes/2026/07/deepseek-dspark/</link><pubDate>Sat, 04 Jul 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/decodes/2026/07/deepseek-dspark/</guid><description>&lt;h2 id="1--o-que-o-paper-afirma"&gt;§1 — O que o paper afirma&lt;/h2&gt;
&lt;p&gt;Antes dos números, o mecanismo — porque sem ele nada faz sentido. &lt;strong&gt;Decodificação especulativa&lt;/strong&gt; (&lt;em&gt;speculative decoding&lt;/em&gt;) é um truque para acelerar a geração de texto de um modelo grande sem trocá-lo: um modelo pequeno e rápido (o &lt;em&gt;rascunhador&lt;/em&gt;, ou &lt;em&gt;drafter&lt;/em&gt;) &amp;ldquo;chuta&amp;rdquo; vários tokens de uma vez; o modelo grande então confere todos esses chutes num único passo, aceita o maior prefixo que ele mesmo teria gerado e descarta o resto. O ponto crucial: &lt;strong&gt;o resultado é matematicamente idêntico ao do modelo grande sozinho&lt;/strong&gt; — a técnica é &lt;em&gt;lossless&lt;/em&gt;, não muda uma vírgula da qualidade da resposta, só a velocidade com que ela sai (§1; §2.1). É pura economia de tempo e de GPU, não um modelo &amp;ldquo;melhor&amp;rdquo;.&lt;/p&gt;</description></item><item><title>Raciocínio de fronteira por 5% do custo: o que o DeepSeek-R1 muda no seu orçamento de IA</title><link>https://thiago.taranto.ai/decodes/2026/07/deepseek-r1/</link><pubDate>Sat, 04 Jul 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/decodes/2026/07/deepseek-r1/</guid><description>&lt;h2 id="1--o-que-o-paper-afirma"&gt;§1 — O que o paper afirma&lt;/h2&gt;
&lt;p&gt;O paper apresenta o DeepSeek-R1, um modelo de raciocínio treinado majoritariamente por &lt;em&gt;reinforcement learning&lt;/em&gt; — sem depender de grandes volumes de dados anotados por humanos para a etapa de raciocínio. A tese central é que a capacidade de &amp;ldquo;pensar em passos&amp;rdquo; (chain-of-thought) pode ser &lt;strong&gt;incentivada por recompensa&lt;/strong&gt;, e não apenas copiada de exemplos.&lt;/p&gt;
&lt;p&gt;Dois resultados sustentam o argumento (ver seções de avaliação e as tabelas de benchmark do paper):&lt;/p&gt;</description></item><item><title>Por que o Whisper transformou cada ligação do seu call center em dado estruturado</title><link>https://thiago.taranto.ai/decodes/2026/06/whisper/</link><pubDate>Sat, 27 Jun 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/decodes/2026/06/whisper/</guid><description>&lt;h2 id="1--o-que-o-paper-afirma"&gt;§1 — O que o paper afirma&lt;/h2&gt;
&lt;p&gt;O paper descreve um sistema de reconhecimento de fala treinado com &lt;strong&gt;supervisão fraca em larga escala&lt;/strong&gt;: em vez de um conjunto pequeno de áudios cuidadosamente rotulados, usa-se uma quantidade enorme de áudio-com-legenda coletado de forma ampla. A aposta é que escala compensa ruído de rótulo.&lt;/p&gt;
&lt;p&gt;Os resultados centrais (ver as seções de avaliação multilíngue do paper):&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Robustez a sotaque, ruído de fundo e vocabulário técnico &lt;strong&gt;sem ajuste fino específico&lt;/strong&gt; — o modelo funciona &amp;ldquo;de fábrica&amp;rdquo; em condições variadas.&lt;/li&gt;
&lt;li&gt;Cobertura multilíngue, incluindo &lt;strong&gt;português&lt;/strong&gt;, com qualidade utilizável em produção — não apenas em inglês de estúdio.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&amp;ldquo;Supervisão fraca&amp;rdquo; aqui quer dizer: aceitar rótulos imperfeitos em troca de volume. É o oposto da abordagem clássica de fonoaudiologia computacional, que dependia de transcrições caras e limpas.&lt;/p&gt;</description></item><item><title>Llama 3 e a decisão que todo CEO vai ter que tomar: alugar inteligência ou ser dono dela</title><link>https://thiago.taranto.ai/decodes/2026/06/llama-3/</link><pubDate>Sat, 20 Jun 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/decodes/2026/06/llama-3/</guid><description>&lt;h2 id="1--o-que-o-paper-afirma"&gt;§1 — O que o paper afirma&lt;/h2&gt;
&lt;p&gt;O paper documenta uma família (&amp;ldquo;herd&amp;rdquo;) de modelos de linguagem abertos, cobrindo diferentes tamanhos, com relatório detalhado de dados, treino e avaliação. O ponto que interessa à diretoria não é a arquitetura — é a &lt;strong&gt;combinação de qualidade competitiva com pesos abertos e documentação de nível industrial.&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Do relatório (ver as seções de avaliação e as tabelas comparativas do paper):&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Os modelos maiores competem com fornecedores fechados de ponta numa faixa ampla de tarefas.&lt;/li&gt;
&lt;li&gt;Os modelos menores são pensados para rodar em hardware acessível — viabilizando implantação &lt;strong&gt;dentro da infraestrutura do cliente&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;O paper trata explicitamente de segurança e de práticas de avaliação, o que reduz o risco de adoção corporativa.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="2--por-que-importa-para-o-negócio"&gt;§2 — Por que importa para o negócio&lt;/h2&gt;
&lt;p&gt;Esta é, no fundo, uma decisão de &lt;strong&gt;make-or-buy&lt;/strong&gt; aplicada à inteligência. Por padrão, a indústria escolheu &amp;ldquo;buy&amp;rdquo;: consumir IA como API de um fornecedor. Modelos abertos de alta qualidade colocam &amp;ldquo;make&amp;rdquo; de volta na mesa — não como projeto de pesquisa, mas como opção operacional.&lt;/p&gt;</description></item><item><title>A nuvem não é a resposta padrão: o caso econômico do on-premise em 2026</title><link>https://thiago.taranto.ai/insights/2026/06/nuvem-nao-e-a-resposta-padrao/</link><pubDate>Mon, 15 Jun 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/insights/2026/06/nuvem-nao-e-a-resposta-padrao/</guid><description>&lt;p&gt;Durante quinze anos, &amp;ldquo;vai pra nuvem&amp;rdquo; foi a resposta padrão para qualquer decisão de infraestrutura. Era o caminho seguro de carreira: ninguém foi demitido por escolher a nuvem. Este ensaio é sobre por que, na Mobi2Buy, tomamos a decisão oposta — e o que aprendemos operando 100% em datacenter próprio.&lt;/p&gt;
&lt;h2 id="a-conta-que-ninguém-faz-no-começo"&gt;A conta que ninguém faz no começo&lt;/h2&gt;
&lt;p&gt;O erro clássico é comparar o preço de tabela da nuvem com o CAPEX de um servidor. A comparação honesta é outra: custo total ao longo de três anos, incluindo transferência de dados, IOPS provisionado, e o imposto silencioso do egresso. Em cargas de trabalho estáveis e intensivas — que são exatamente as nossas — a curva vira a favor do on-premise mais cedo do que a narrativa dominante admite.&lt;/p&gt;</description></item><item><title>15 devs, 50 PRs por semana e um agente de IA revisando cada um</title><link>https://thiago.taranto.ai/insights/2026/05/code-review-com-ia/</link><pubDate>Wed, 20 May 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/insights/2026/05/code-review-com-ia/</guid><description>&lt;p&gt;Com quinze engenheiros abrindo cerca de cinquenta PRs por semana, o gargalo do review humano ficou visível: ou os revisores viravam engarrafamento, ou a qualidade caía. Colocamos um agente de IA para revisar cada PR. Este é o relato honesto do que funcionou e do que quebrou.&lt;/p&gt;
&lt;h2 id="o-que-o-agente-é-bom-em-pegar"&gt;O que o agente é bom em pegar&lt;/h2&gt;
&lt;p&gt;Consistência. O agente nunca está cansado, nunca deixa passar um padrão de nomenclatura por pressa, e reclama do mesmo jeito na sexta-feira à noite e na segunda de manhã. Para regras de estilo, contratos de API internos e anti-padrões conhecidos, ele é um revisor incansável e barato.&lt;/p&gt;</description></item><item><title>322 milhões de dead tuples depois: anatomia de um incidente PostgreSQL</title><link>https://thiago.taranto.ai/insights/2026/04/incidente-postgresql/</link><pubDate>Fri, 10 Apr 2026 00:00:00 +0000</pubDate><guid>https://thiago.taranto.ai/insights/2026/04/incidente-postgresql/</guid><description>&lt;p&gt;Este é um post-mortem honesto. Não o tipo higienizado que vira slide de conferência, mas o relato de um incidente que começou meses antes de acontecer — em decisões de tuning que adiamos porque &amp;ldquo;estava funcionando&amp;rdquo;.&lt;/p&gt;
&lt;h2 id="o-sintoma-não-é-o-problema"&gt;O sintoma não é o problema&lt;/h2&gt;
&lt;p&gt;O alerta que disparou foi latência de query. O problema real eram 322 milhões de &lt;em&gt;dead tuples&lt;/em&gt; acumuladas: versões de linha que o &lt;code&gt;VACUUM&lt;/code&gt; não conseguiu recolher no ritmo em que criávamos. O banco estava carregando um cemitério e pagando pedágio em cada leitura.&lt;/p&gt;</description></item></channel></rss>