Papers Decodificados

RSS →

Toda semana, o paper de IA que mais importa — explicado para C-Level em português, sem matemática e sem hype, com consequência de negócio.

§1 O que o paper afirma §2 Por que importa para o negócio §3 O que fazer a respeito §4 Limite da evidência
Fonte ↗ [huggingface.co] · 4 jul 2026 decode · 7 min

A mesma GPU, 60–85% mais rápida por usuário: o ganho de inferência que não exige trocar de modelo

DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

Para a diretoria: Um novo método de decodificação da DeepSeek entrega 60–85% mais velocidade por usuário na mesma infraestrutura — sem trocar o modelo e sem perder qualidade (a resposta é matematicamente idêntica). Para quem serve IA em escala, é menos custo por token e latência que desbloqueia produtos antes inviáveis. Ressalva: os ganhos de produção são auto-reportados e dependem da infra da própria DeepSeek.

arXiv:2606.11690 [cs.DC] · 4 jul 2026 decode · 7 min

A conta do 'rodar em casa' está errada: por que o custo real de inferência varia até 36×

Beyond Per-Token Pricing: A Concurrency-Aware Methodology for LLM Infrastructure Cost Estimation

Para a diretoria: A planilha que diz que rodar IA em casa é mais barato que a API quase sempre assume a GPU 100% ocupada — e ela nunca está. No mesmo hardware, o custo por token varia até 36× conforme o volume de tráfego. Em tráfego baixo, a economia do self-hosting evapora: pode custar mais caro que o fornecedor.