5 publicação(ões) com esta tag.

Decodes

arXiv:2607.24653 [cs.CL] · 30 jul 2026 decode · 7 min

Fronteira 'aberta' a um terço do custo: o Kimi K3 e a pressão sobre o seu contrato de IA

Kimi K3: Open Frontier Intelligence

Para a diretoria: A Moonshot AI lançou o Kimi K3, o primeiro modelo aberto de classe 3 trilhões de parâmetros, com desempenho perto da fronteira proprietária (Claude Fable 5, GPT-5.6 Sol) e a uma fração do custo por tarefa. Para o board: menos sobre rodar o modelo — 2,8T de parâmetros exigem infra pesada — e mais sobre alavanca de negociação e make-vs-buy. A letra miúda está nos benchmarks auto-reportados e na licença comercial, que precisa ser verificada antes de qualquer decisão.

Fonte ↗ [huggingface.co] · 4 jul 2026 decode · 7 min

A mesma GPU, 60–85% mais rápida por usuário: o ganho de inferência que não exige trocar de modelo

DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

Para a diretoria: Um novo método de decodificação da DeepSeek entrega 60–85% mais velocidade por usuário na mesma infraestrutura — sem trocar o modelo e sem perder qualidade (a resposta é matematicamente idêntica). Para quem serve IA em escala, é menos custo por token e latência que desbloqueia produtos antes inviáveis. Ressalva: os ganhos de produção são auto-reportados e dependem da infra da própria DeepSeek.

arXiv:2606.11690 [cs.DC] · 4 jul 2026 decode · 7 min

A conta do 'rodar em casa' está errada: por que o custo real de inferência varia até 36×

Beyond Per-Token Pricing: A Concurrency-Aware Methodology for LLM Infrastructure Cost Estimation

Para a diretoria: A planilha que diz que rodar IA em casa é mais barato que a API quase sempre assume a GPU 100% ocupada — e ela nunca está. No mesmo hardware, o custo por token varia até 36× conforme o volume de tráfego. Em tráfego baixo, a economia do self-hosting evapora: pode custar mais caro que o fornecedor.

Insights

15 jun 2026 · 8 min

A nuvem não é a resposta padrão: o caso econômico do on-premise em 2026

Rodamos 100% da operação em datacenter próprio. As contas que fizemos, os riscos que aceitamos e onde a nuvem ainda ganha.

ler →