A mesma GPU, 60–85% mais rápida por usuário: o ganho de inferência que não exige trocar de modelo
DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
Para a diretoria: Um novo método de decodificação da DeepSeek entrega 60–85% mais velocidade por usuário na mesma infraestrutura — sem trocar o modelo e sem perder qualidade (a resposta é matematicamente idêntica). Para quem serve IA em escala, é menos custo por token e latência que desbloqueia produtos antes inviáveis. Ressalva: os ganhos de produção são auto-reportados e dependem da infra da própria DeepSeek.