DeepSeek V4 Flash perdeu para o Opus 4.8 nos 9 benchmarks
O V4 Flash custa 0,14 dólares à entrada e 0,28 à saída por milhão de tokens. Verifiquei se o desconto de 97 a 99% compensa perder os benchmarks.

Nesta página
- Até que ponto o DeepSeek V4 Flash se aproxima do Opus 4.8?
- O que é o DeepSeek V4 Flash 0731?
- Em que resultado do Opus 4.8 deve acreditar?
- O que mostram os primeiros resultados independentes?
- O que compra 0,28 dólares por milhão de tokens na prática?
- O que perde em troca do desconto?
- O meu veredicto: teste o V4 Flash como agente, não como revisor
O DeepSeek V4 Flash não substitui o Opus 4.8. A própria tabela da DeepSeek dá a vitória ao Opus nos nove benchmarks, embora duas diferenças sejam pequenas [2]. O que torna o V4 Flash interessante é o preço: 0,14 dólares por milhão de tokens de entrada e 0,28 de saída [3], contra 5 e 25 dólares no Opus [4].
Até que ponto o DeepSeek V4 Flash se aproxima do Opus 4.8?
O DeepSeek V4 Flash aproxima-se do Opus 4.8 em dois dos nove testes da DeepSeek, mas fica muito atrás nos benchmarks que exigem trabalho sobre repositórios. O Opus lidera por 0,5 pontos no Agents’ Last Exam e 2,3 no Terminal-Bench 2.1, mas a diferença sobe para 15,5 pontos no NL2Repo e 12,1 no DSBench-Hard [2].
| Benchmark | V4 Flash 0731 | Opus 4.8 | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 82,7 | 85,0 (Melhor valor da linha) | 81,0 |
| NL2Repo | 54,2 | 69,7 (Melhor valor da linha) | 48,9 |
| Cybergym | 76,7 | 83,1 (Melhor valor da linha) | - |
| DeepSWE | 54,4 | 58,0 (Melhor valor da linha) | 46,2 |
| Toolathlon Verified | 70,3 | 76,2 (Melhor valor da linha) | 59,9 |
| Agents' Last Exam | 25,2 | 25,7 (Melhor valor da linha) | 23,8 |
| AutomationBench Public | 25,1 | 27,2 (Melhor valor da linha) | 12,9 |
| DSBench FullStack | 68,7 | 71,6 (Melhor valor da linha) | 61,8 |
| DSBench Hard | 59,6 | 71,7 (Melhor valor da linha) | 54,5 |
O padrão importa mais do que qualquer resultado isolado. O V4 Flash mantém-se perto do Opus nas tarefas de terminal, mas afasta-se quando o trabalho exige compreender ou desenvolver um repositório. Ainda assim, lidera o GLM-5.2 nos oito testes que os dois modelos têm em comum.
A DeepSeek faz uma afirmação mais limitada do que grande parte da cobertura. A model card diz que a nova versão supera a preview do V4 Pro, um modelo maior, embora ative muito menos parâmetros [2]. Publicar um gráfico que mostra todas as derrotas perante o Opus também é mais útil do que mostrar apenas as linhas que um modelo novo vence.
Contudo, a comparação já está desatualizada. O Opus 4.8 era o modelo mais forte da Anthropic quando saiu, a 28 de maio de 2026 [7], mas dez semanas depois aparece na secção de modelos legacy da lista da Anthropic [8]. O Opus 5 chegou a 24 de julho com os mesmos preços de 5 dólares à entrada e 25 à saída, e a Anthropic recomenda-o agora para novas tarefas, com o Fable 5 acima de ambos [9]. O V4 Flash concorre com o melhor modelo da Anthropic de maio, não com o de agosto. A DeepSeek também avançou, e trato a sequência em DeepSeek V4.1 Flash, a sua API barata e os seus pesos abertos enormes.
O que é o DeepSeek V4 Flash 0731?
O DeepSeek-V4-Flash-0731 chegou a 31 de julho de 2026 como a versão oficial da preview do V4 Flash, depois de um novo pós-treino [1]. Mantém a arquitetura e o tamanho: é um modelo de mistura de especialistas com 284 mil milhões de parâmetros no total, 13 mil milhões ativos por token e uma janela de contexto de um milhão de tokens [5].
A preview estava disponível desde 24 de abril. Para a versão 0731, a DeepSeek repetiu apenas as fases finais do treino.
Os pesos estão disponíveis no Hugging Face sob licença MIT, pelo que o uso comercial e o alojamento próprio não têm restrições [2].
Na API, a DeepSeek substituiu a versão sem mudar o identificador: o modelo continua a chamar-se deepseek-v4-flash, e as integrações existentes passaram para a nova versão sem qualquer alteração na configuração [1]. Isto é cómodo para os utilizadores, mas complica a citação de resultados, porque “V4 Flash” passou a designar duas versões diferentes consoante a data da medição. O modelo disponibiliza um parâmetro de esforço de raciocínio com três níveis, low, high e max, em vez de uma variante de raciocínio separada [2].
O preço foi o que chamou a atenção para o lançamento. A Nikkei Asia descreveu-o como parte de uma guerra de preços cada vez mais intensa entre modelos de IA e noticiou que a DeepSeek pretende introduzir mais tarde preços de hora de ponta [6]. A página de preços da DeepSeek confirma que estes duplicarão nas horas de ponta quando a medida entrar em vigor, o que ainda não tinha acontecido a 3 de agosto de 2026 [3]. O V4 Pro, maior, continua em preview a 0,435 dólares de entrada e 0,87 de saída, com o lançamento da versão oficial anunciado para breve [1] [3].
- preço de entrada, sem cache
- 0,14 $/MTok
- Opus 4.8: 5 $
- preço de saída
- 0,28 $/MTok
- Opus 4.8: 25 $
- janela de contexto
- 1M
- saída máxima de 384K tokens
- parâmetros ativos
- 13B
- de 284B no total, licença MIT
Por milhão de tokens de saída, o Opus 4.8 custa cerca de 89 vezes mais do que o V4 Flash. A diferença é grande o suficiente para ser relevante, mas uma comparação de preços continua a precisar de uma comparação credível entre as capacidades. É aí que a variação dos resultados do Opus cria dificuldades.
Em que resultado do Opus 4.8 deve acreditar?
Nenhum resultado isolado do Opus 4.8 é estável o suficiente para servir de referência nesta comparação. O harness da DeepSeek indica 85,0 no Terminal-Bench 2.1 [2], a tabela pública do Terminal-Bench mostra 78,9 por cento com o Claude Code [10], e a system card da Anthropic indica 74,6 por cento com esforço high no harness Terminus-2 [7].
Ver os dados em tabela
| Fonte | Valor |
|---|---|
| DeepSeek Harness, esforço max | 85,0% |
| Tabela do Terminal-Bench, Claude Code | 78,9% |
| System card da Anthropic, Terminus-2, esforço high | 74,6% |
Os 82,7 do V4 Flash ficam dentro dessa amplitude de 10,4 pontos. Consoante o resultado do Opus escolhido, o modelo da DeepSeek fica 2,3 pontos atrás, 3,8 à frente ou 8,1 à frente. Os resultados, por si só, não permitem concluir qual dos dois é melhor em tarefas de terminal.
A DeepSeek publicou o resultado mais alto dos três para o Opus, portanto não prejudicou o concorrente. A amplitude de 10,4 pontos resulta de harnesses de agentes, níveis de esforço e limites de tempo diferentes. A system card da Anthropic também assinala que o Terminal-Bench penaliza endpoints lentos, porque as tarefas estão sujeitas a limites fixos de tempo real [7]. Estas configurações não podem ser comparadas diretamente.
Um terceiro poderia resolver a comparação se executasse os dois modelos no mesmo harness. Não encontrei uma versão pública do DeepSeek Harness nem uma reprodução independente de qualquer uma das nove linhas até 3 de agosto de 2026. Até isso acontecer, temos um resultado do fornecedor, não uma comparação reproduzida de forma independente.
O que mostram os primeiros resultados independentes?
A Artificial Analysis coloca o V4 Flash entre os melhores modelos de baixo custo, não entre os modelos de topo. O Intelligence Index dá-lhe 50 pontos, dez acima da preview de abril e um abaixo do GPT-5.6 Luna com esforço max [11]. Como o índice não inclui o Opus 4.8, não reproduz a comparação da DeepSeek. Quanto peso pode suportar uma única posição no índice é outra questão, e o meu exemplo é a reavaliação do Muse Spark 1.3 nesse mesmo índice.
Na mesma tabela, a 3 de agosto de 2026, o Gemini 3.6 Flash também tinha 50 pontos, o GLM-5.2 chegou aos 51, o GPT-5.6 Terra aos 55 e o Kimi K3 aos 57 [12]. Esta é a única posição independente e normalizada que encontrei para a versão 0731. Analisei o mais forte deles na minha verificação do hype do Kimi K3 e do GLM-5.2.
A Artificial Analysis também confirmou a afirmação central da DeepSeek de que o V4 Flash supera o V4 Pro, um modelo maior, a um custo inferior. Executar o índice completo custou 72,02 dólares com o V4 Flash [13], contra 176,34 dólares com o V4 Pro, que obteve menos seis pontos, com um total de 44 [14]. É um resultado melhor por cerca de 40 por cento do custo.
O consumo de tokens continua a influenciar a fatura final. O V4 Flash precisou de cerca de 206 milhões de tokens de saída para concluir o índice, menos 12 por cento do que a versão de abril [11], mas mais do que os 180 milhões usados pelo V4 Pro [14]. O modelo é barato por token, mas não poupa tokens, pelo que estimativas baseadas no consumo de outro modelo ficarão aquém do custo real.
Dois outros testes da Artificial Analysis mostram uma grande melhoria em relação à preview de abril. No GDPval-AA v2, uma comparação de tarefas de trabalho avaliada por votos de preferência, a nova versão atingiu um Elo de 1559, contra 1189 anteriormente [11]. A sua taxa de alucinação no AA-Omniscience melhorou 12 pontos para 84 por cento, o que representa progresso a partir de um mau ponto de partida, não um bom resultado [11].
A tabela WebDev também coloca o V4 Flash abaixo dos modelos de topo. Na Arena, onde as pessoas votam em aplicações web geradas, o V4 Flash com esforço high ocupava o sétimo lugar, com um Elo de 1577 a 3 de agosto de 2026, contra 1705 do Opus 5 Max no primeiro lugar [15].
A velocidade desta versão continua por medir. Não encontrei nenhuma medição independente de tokens por segundo para a versão 0731, pelo que todos os números de velocidade em circulação a 3 de agosto de 2026 pertenciam a uma versão anterior do V4 Flash [16].
O que compra 0,28 dólares por milhão de tokens na prática?
Os primeiros relatos descrevem um agente de programação de baixo custo que precisa de acompanhamento próximo, não um substituto geral para um modelo mais forte. O contexto em cache pode baixar a fatura, enquanto as futuras tarifas nas horas de ponta e os descontos dos revendedores tornam o valor de 0,28 dólares apenas um ponto de partida.
A entrada em cache custa 0,0028 dólares por milhão de tokens, um quinquagésimo do preço sem cache [3], e os fluxos de agentes voltam a enviar contexto praticamente igual em cada turno. Em sentido contrário, a DeepSeek diz que os preços duplicarão nas horas de ponta em Pequim quando essa política entrar em vigor [3]. No lançamento, a OpenRouter aplicou um desconto de 38 por cento, para cerca de 0,09 dólares à entrada e 0,17 à saída [17]. Assim, os preços de saída de 0,17 ou 0,18 dólares citados noutros locais referem-se à promoção do revendedor, não à tabela da DeepSeek.
Há uma ressalva para todos os preços por token entre fornecedores neste artigo. Segundo a documentação de preços da Anthropic, os modelos Claude a partir do 4.7 usam um tokenizador que produz cerca de 30 por cento mais tokens para o mesmo texto [4], pelo que os rácios de preço por token entre fornecedores são aproximações. Mesmo com uma correção de 30 por cento, a diferença de 89 vezes na saída continua muito grande.
Um engenheiro publicou no Hacker News um painel de 30 dias com 4,55 dólares por 3.467 pedidos à API e 323 milhões de tokens. A sua conclusão foi que o modelo “não desiludiu nada em tarefas de programação ou revisão. Para tudo o resto, use outro modelo” [18]. A média é de cerca de 0,014 dólares por milhão de tokens, abaixo de todos os preços indicados exceto o da entrada em cache, pelo que a maior parte do tráfego terá sido entrada em cache. O mesmo utilizador diz que o modelo é fraco a escrever prosa, melhora com instruções precisas e ferramentas de autorrevisão, e que “mesmo assim, você tem de rever 100% do código como se o modelo estivesse a tentar vender-lhe um seguro” [19].
Outro comentador atingiu um limite apertado de tokens de saída na OpenRouter depois de o modelo passar demasiado tempo a raciocinar, mas concluiu na mesma que o V4 Flash “substituiu os modelos Kimi para mim” [20]. O teste feito por Simon Willison no próprio dia aponta para uma configuração útil: o resultado com o esforço predefinido foi claramente pior do que com high [21]. Em conjunto, os relatos justificam usar esforço high, tarefas bem delimitadas e um modelo mais forte ou uma pessoa na revisão.
O que perde em troca do desconto?
O V4 Flash não aceita imagens, e um estudo controlado encontrou muito mais censura em perguntas sensíveis sobre a China do que em perguntas de controlo equivalentes [11] [22]. Estas limitações são relevantes para fluxos de programação multimodais e para qualquer produto que responda a perguntas sobre assuntos politicamente sensíveis.
A CTGT, uma empresa de investigação que testa o comportamento de modelos, mediu uma diferença de 45,45 pontos na censura entre perguntas sensíveis sobre a China e perguntas de controlo com a mesma estrutura. Os investigadores testaram pesos alojados por eles próprios para excluir os filtros do fornecedor da API, enquanto um modelo destilado a partir das respostas do V4 Flash não mostrou sinais significativos do mesmo comportamento [22]. O resultado aplica-se, portanto, aos pesos, não apenas ao endpoint alojado pela DeepSeek. A destilação é também o tema do meu artigo sobre as marcas de água no texto do Claude, cuja razão é a UE.
Sem entrada de imagens, o modelo não consegue executar os ciclos de frontend guiados por capturas de ecrã usados por agentes multimodais [11]. A API oficial é opcional, porque os pesos com licença MIT [2] já estão disponíveis através da OpenRouter e de outros fornecedores ocidentais [17]. Escolher outro fornecedor pode mudar o endpoint, a jurisdição dos dados e o preço, mas não remove comportamentos presentes nos pesos.
O meu veredicto: teste o V4 Flash como agente, não como revisor
Vale a pena testar o V4 Flash porque disponibiliza um modelo desta classe por um a três por cento dos preços do Opus, não porque seja melhor do que o Claude. A própria tabela da DeepSeek mostra as derrotas, e os dados independentes colocam-no entre os modelos de baixo custo mais fortes, não entre os modelos de topo.
O meu próximo passo é testar o V4 Flash no meu repositório habitual com o esforço de raciocínio em high e um modelo mais forte no lugar de revisão. Se um harness independente vier a executar os dois modelos nas mesmas condições, voltarei à comparação. Até lá, o desconto aumenta o número de tarefas que posso automatizar, mas não elimina a necessidade de revisão.
Fontes
- Change log
- DeepSeek-V4-Flash-0731 model card
- Models & Pricing
- Pricing
- DeepSeek-V4 model card
- DeepSeek releases beta version of V4 models as AI price war heats up
- System Card: Claude Opus 4.8
- Models overview
- Introducing Claude Opus 5
- Terminal-Bench 2.1 leaderboard
- DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index
- Models leaderboard
- DeepSeek V4 Flash 0731: intelligence, performance and price
- DeepSeek V4 Pro: intelligence, performance and price
- Arena leaderboard
- DeepSeek V4 Flash providers
- DeepSeek V4 Flash
- Comment with 30-day usage figures on the V4 Flash release thread
- Comment on working practices with V4 Flash
- Comment on output limits
- deepseek-ai/DeepSeek-V4-Flash-0731
- Distillation censorship transfer





