Um jogo inteiro é uma tarefa longa, bagunçada e com um juiz honesto no fim: ou dá para jogar, ou não dá. Esta tabela registra quanto cada modelo gastou para chegar lá, declarado por quem fez.
| Jogo | Quem fez | Modelo | Agente | Tokens novos | Cache | Custo | Linhas | Medição |
|---|---|---|---|---|---|---|---|---|
| BANCA | Lucca Pinto | claude-opus-5-5, claude-opus-5 | Oh My Pi, Oh My Pi (subagentes) | 1,2 M | 342,6 M | US$ 121,68 | 18.873 | medido |
| TRAVESSIA | Lucca Pinto | claude-opus-5 | Oh My Pi | 103,0 k | 0 | US$ 1,54 | 6.960 | estimado |
| SUBSOLO | Lucca Pinto | claude-opus-5 | Oh My Pi | 705,0 k | 0 | US$ 8,30 | 6.568 | estimado |
| GUARDRAIL | Lucca Pinto | claude-opus-5 | Oh My Pi | 165,0 k | 0 | US$ 2,48 | 6.681 | estimado |
| CURVA | Lucca Pinto | claude-opus-5 | Oh My Pi | 441,0 k | 0 | US$ 5,31 | 4.910 | estimado |
| SEIVA | Lucca Pinto | claude-opus-5 | Claude Code | 70,0 k | 0 | US$ 1,05 | 1.127 | estimado |
| PROCESSO | Lucca Pinto | claude-opus-5 | Claude Code | 44,0 k | 0 | US$ 0,66 | 835 | estimado |
| CRIPTA | Lucca Pinto | claude-opus-5 | Claude Code | 86,0 k | 0 | US$ 1,30 | 1.044 | estimado |
| A CEIA | Lucca Pinto | claude-opus-5 | Claude Code | 31,0 k | 0 | US$ 0,47 | 696 | estimado |
| ANTENA | Lucca Pinto | claude-opus-5 | Claude Code | 165,0 k | 0 | US$ 2,48 | 1.733 | estimado |
| ATTENTION IS ALL YOU KILL | Lucca Pinto | deepseek-flash | Hermes Agent (Talos) | 1,9 M | 159,1 M | US$ 1,03 | 10.709 | medido |
| Modelo | Jogos | Tokens novos | Cache | Custo | Linhas | Tokens/linha | Linhas/US$ |
|---|---|---|---|---|---|---|---|
| claude-opus-5 | 10 | 2,1 M | 26,3 M | US$ 49,85 | 49.427 | 43,4 | 991 |
| deepseek-flash | 1 | 1,9 M | 159,1 M | US$ 1,03 | 10.709 | 176,9 | 10.397 |
| claude-opus-5-5 | 1 | 839,5 k | 316,2 M | US$ 95,42 | 18.873 | 44,5 | 197 |
| Agente | Jogos | Tokens novos | Cache | Custo | Linhas | Tokens/linha | Linhas/US$ |
|---|---|---|---|---|---|---|---|
| Oh My Pi | 5 | 2,3 M | 316,2 M | US$ 113,05 | 43.992 | 51,2 | 389 |
| Claude Code | 5 | 396,0 k | 0 | US$ 5,96 | 5.435 | 72,9 | 911 |
| Hermes Agent (Talos) | 1 | 1,9 M | 159,1 M | US$ 1,03 | 10.709 | 176,9 | 10.397 |
| Oh My Pi (subagentes) | 1 | 337,1 k | 26,3 M | US$ 26,26 | 18.873 | 17,9 | 718 |
A mesma tarefa muda de preço conforme a ferramenta que dirige o modelo: quanto contexto ela reenvia, quanto ela acerta de cache, quantas chamadas ela gasta para aplicar uma edição. Por isso agente é uma coluna do benchmark, não um detalhe.
| Provider | Jogos | Tokens novos | Cache | Custo | Linhas | Tokens/linha | Linhas/US$ |
|---|---|---|---|---|---|---|---|
| Anthropic | 10 | 3,0 M | 342,6 M | US$ 145,27 | 49.427 | 60,4 | 340 |
| DeepSeek | 1 | 1,9 M | 159,1 M | US$ 1,03 | 10.709 | 176,9 | 10.397 |
Tokens novos é entrada mais saída. Cache fica à parte porque depende da ferramenta, não do trabalho: numa sessão longa cada turno reenvia o contexto acumulado, e quanto disso vira leitura barata de cache é decisão do agente. Somar os dois num número só compara agentes, não jogos.
Linhas por dólar é uma medida de escala, não de qualidade. Um modelo que escreve um jogo enxuto e bom perde nessa coluna para um que despeja código. Leia junto com o jogo: ele está a um clique, e ou é divertido, ou não é.
Medição diz de onde veio o número: medido saiu da contabilidade da própria ferramenta, estimado foi reconstruído por quem fez, parcial cobre só parte das sessões. Ninguém audita a declaração de ninguém — o que o repositório garante é que ela está escrita, datada e versionada ao lado do código.
Isto não é um benchmark controlado: jogos diferentes, pessoas diferentes, ambições diferentes. O que ele mostra é a ordem de grandeza real de construir algo que funciona conversando com um modelo — o número que nenhum eval de tarefa curta dá.