AI-GAMES / BENCHMARK

O que custou cada jogo

Um jogo inteiro é uma tarefa longa, bagunçada e com um juiz honesto no fim: ou dá para jogar, ou não dá. Esta tabela registra quanto cada modelo gastou para chegar lá, declarado por quem fez.

JOGOS11
MODELOS3
TOKENS NOVOS4,9 M
TOKENS DE CACHE501,6 M
CHAMADAS3.031
CUSTO TOTALUS$ 146,30

Por jogo

JogoQuem fezModeloAgenteTokens novosCacheCustoLinhasMedição
BANCALucca Pintoclaude-opus-5-5, claude-opus-5Oh My Pi, Oh My Pi (subagentes)1,2 M342,6 MUS$ 121,6818.873medido
TRAVESSIALucca Pintoclaude-opus-5Oh My Pi103,0 k0US$ 1,546.960estimado
SUBSOLOLucca Pintoclaude-opus-5Oh My Pi705,0 k0US$ 8,306.568estimado
GUARDRAILLucca Pintoclaude-opus-5Oh My Pi165,0 k0US$ 2,486.681estimado
CURVALucca Pintoclaude-opus-5Oh My Pi441,0 k0US$ 5,314.910estimado
SEIVALucca Pintoclaude-opus-5Claude Code70,0 k0US$ 1,051.127estimado
PROCESSOLucca Pintoclaude-opus-5Claude Code44,0 k0US$ 0,66835estimado
CRIPTALucca Pintoclaude-opus-5Claude Code86,0 k0US$ 1,301.044estimado
A CEIALucca Pintoclaude-opus-5Claude Code31,0 k0US$ 0,47696estimado
ANTENALucca Pintoclaude-opus-5Claude Code165,0 k0US$ 2,481.733estimado
ATTENTION IS ALL YOU KILLLucca Pintodeepseek-flashHermes Agent (Talos)1,9 M159,1 MUS$ 1,0310.709medido

Por modelo

ModeloJogosTokens novosCacheCustoLinhasTokens/linhaLinhas/US$
claude-opus-5102,1 M26,3 MUS$ 49,8549.42743,4991
deepseek-flash11,9 M159,1 MUS$ 1,0310.709176,910.397
claude-opus-5-51839,5 k316,2 MUS$ 95,4218.87344,5197

Por agente

AgenteJogosTokens novosCacheCustoLinhasTokens/linhaLinhas/US$
Oh My Pi52,3 M316,2 MUS$ 113,0543.99251,2389
Claude Code5396,0 k0US$ 5,965.43572,9911
Hermes Agent (Talos)11,9 M159,1 MUS$ 1,0310.709176,910.397
Oh My Pi (subagentes)1337,1 k26,3 MUS$ 26,2618.87317,9718

A mesma tarefa muda de preço conforme a ferramenta que dirige o modelo: quanto contexto ela reenvia, quanto ela acerta de cache, quantas chamadas ela gasta para aplicar uma edição. Por isso agente é uma coluna do benchmark, não um detalhe.

Por provider

ProviderJogosTokens novosCacheCustoLinhasTokens/linhaLinhas/US$
Anthropic103,0 M342,6 MUS$ 145,2749.42760,4340
DeepSeek11,9 M159,1 MUS$ 1,0310.709176,910.397

Como ler isto

Tokens novos é entrada mais saída. Cache fica à parte porque depende da ferramenta, não do trabalho: numa sessão longa cada turno reenvia o contexto acumulado, e quanto disso vira leitura barata de cache é decisão do agente. Somar os dois num número só compara agentes, não jogos.

Linhas por dólar é uma medida de escala, não de qualidade. Um modelo que escreve um jogo enxuto e bom perde nessa coluna para um que despeja código. Leia junto com o jogo: ele está a um clique, e ou é divertido, ou não é.

Medição diz de onde veio o número: medido saiu da contabilidade da própria ferramenta, estimado foi reconstruído por quem fez, parcial cobre só parte das sessões. Ninguém audita a declaração de ninguém — o que o repositório garante é que ela está escrita, datada e versionada ao lado do código.

Isto não é um benchmark controlado: jogos diferentes, pessoas diferentes, ambições diferentes. O que ele mostra é a ordem de grandeza real de construir algo que funciona conversando com um modelo — o número que nenhum eval de tarefa curta dá.