Tag: Open Weights

todas as tags →

5 publicação(ões) com esta tag.

Decodes

arXiv:2607.24653 [cs.CL] 30 jul 2026 7 min

Fronteira 'aberta' a um terço do custo: o Kimi K3 e a pressão sobre o seu contrato de IA

Kimi K3: Open Frontier Intelligence

Para a diretoria: A Moonshot AI lançou o Kimi K3, o primeiro modelo aberto de classe 3 trilhões de parâmetros, com desempenho perto da fronteira proprietária (Claude Fable 5, GPT-5.6 Sol) e a uma fração do custo por tarefa. Para o board: menos sobre rodar o modelo — 2,8T de parâmetros exigem infra pesada — e mais sobre alavanca de negociação e make-vs-buy. A letra miúda está nos benchmarks auto-reportados e na licença comercial, que precisa ser verificada antes de qualquer decisão.

Open weightsCustoEstratégiaLLMs
arXiv:2501.12948 [cs.CL] 4 jul 2026 6 min

Raciocínio de fronteira por 5% do custo: o que o DeepSeek-R1 muda no seu orçamento de IA

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Para a diretoria: O custo de raciocínio avançado caiu uma ordem de grandeza — e o modelo é aberto. Se sua estratégia de IA assume que capacidade de ponta exige contrato com um único fornecedor americano, ela envelheceu.

LLMsCustoOpen weights
Fonte ↗ [huggingface.co] 4 jul 2026 7 min

A mesma GPU, 60–85% mais rápida por usuário: o ganho de inferência que não exige trocar de modelo

DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

Para a diretoria: Um novo método de decodificação da DeepSeek entrega 60–85% mais velocidade por usuário na mesma infraestrutura — sem trocar o modelo e sem perder qualidade (a resposta é matematicamente idêntica). Para quem serve IA em escala, é menos custo por token e latência que desbloqueia produtos antes inviáveis. Ressalva: os ganhos de produção são auto-reportados e dependem da infra da própria DeepSeek.

InfraCustoOpen weights
arXiv:2606.11690 [cs.DC] 4 jul 2026 7 min

A conta do 'rodar em casa' está errada: por que o custo real de inferência varia até 36×

Beyond Per-Token Pricing: A Concurrency-Aware Methodology for LLM Infrastructure Cost Estimation

Para a diretoria: A planilha que diz que rodar IA em casa é mais barato que a API quase sempre assume a GPU 100% ocupada — e ela nunca está. No mesmo hardware, o custo por token varia até 36× conforme o volume de tráfego. Em tráfego baixo, a economia do self-hosting evapora: pode custar mais caro que o fornecedor.

InfraCustoOpen weights