✦ Felipe Tâmbara · @felipetambara.ia

Central de Material

Todo material que eu entrego nos meus conteúdos, num lugar só. Escolhe o tema e resgata o passo a passo.

Os 5 plugins pro Claude Code parar de entregar tela feia
Resgatar material →

Os 5 plugins pro Claude Code parar de entregar tela feia

O guia de instalação dos 5 plugins do vídeo (mais o 21st MCP de bônus): o que cada um faz, o comando exato pra instalar no Claude Code, conferido no repositório oficial, e a ordem em que eles trabalham juntos num projeto de front.

As 6 da semana em IA (e por que a China é o assunto)
Resgatar material →

As 6 da semana em IA (e por que a China é o assunto)

As 6 coisas que saíram essa semana e valem seu tempo, na mesma ordem do vídeo: 3 modelos abertos que rodam na sua máquina, um time de agentes com computador próprio e 2 skills open source pra usar no Claude Code hoje. Com o link de cada uma.

A lista de leads que o Claude monta sozinho
Resgatar material →

A lista de leads que o Claude monta sozinho

O scraper open source que deixa o Claude varrer a web, puxar o contato público das empresas do seu nicho e devolver tudo numa planilha limpa. Roda na sua máquina, com modelo local, sem assinatura de scraper.

✦ Felipe Tâmbara

Os 5 plugins que o Claude Code deveria já vir instalado

Resgatar material →

Os 5 plugins que o Claude Code deveria já vir instalado

Limite de uso que não trava, memória entre sessões, metade do gasto de token, setup auditado pela própria Anthropic e uma skill que melhora as suas outras skills sozinha. Com o comando de instalação de cada um, na ordem.

A alternativa grátis ao ElevenLabs que clona sua voz com 3 segundos
Resgatar material →

A alternativa grátis ao ElevenLabs que clona sua voz com 3 segundos

Clone de voz, dublagem de vídeo, ditado e audiolivro em 646 idiomas, rodando na sua máquina, sem conta, sem API key e sem mensalidade. Com servidor MCP pra plugar no Claude Code.

Os 5 cursos com certificado grátis
Resgatar material →

Os 5 cursos com certificado grátis

Os links diretos dos 5 cursos do carrossel, quanto tempo cada um leva de verdade, e como sair com o certificado sem pagar nos dois que parecem pagos.

A skill que tira a cara de IA de qualquer texto
Resgatar material →

A skill que tira a cara de IA de qualquer texto

33 padrões de escrita de IA catalogados pela Wikipedia, virados numa skill que funciona em qualquer agente. Como instalar, como calibrar com a sua própria voz, e a lista completa do que ela caça.

Um modelo de 2,78 trilhões de parâmetros rodando num CPU com 8 GB de RAM
Resgatar material →

Um modelo de 2,78 trilhões de parâmetros rodando num CPU com 8 GB de RAM

O motor de inferência em C que roda o Kimi K3 sem GPU, sem framework e sem CUDA, num binário de 176 KB. Aqui está como ele faz isso, o teste que você roda em um minuto sem baixar nada, e o caminho completo se quiser ir até o fim.

O modelo de 550B da NVIDIA rodando de graça no seu terminal
Resgatar material →

O modelo de 550B da NVIDIA rodando de graça no seu terminal

Como conectar a API hospedada da NVIDIA ao OpenCode e usar o Nemotron 3 Ultra como agente de código, sem GPU nenhuma. Passo a passo, o arquivo de configuração completo, e o que muda quando o endpoint gratuito acabar.

As 15 ferramentas de IA, categoria por categoria
Resgatar material →

As 15 ferramentas de IA, categoria por categoria

A lista fechada do vídeo: 15 ferramentas em 12 categorias, o que cada uma resolve de verdade, em que momento ela entra e o link de todas. Com a fonte original aberta no fim, incluindo o PDF e as 47 do site.

As 15 IAs de graça do Google
Resgatar material →

As 15 IAs de graça do Google

A lista completa com o link de todas as 15, o que cada uma faz de verdade, quais valem o seu tempo e por qual começar dependendo do que você faz.

O estúdio de vídeo e imagem com IA que roda no seu PC
Resgatar material →

O estúdio de vídeo e imagem com IA que roda no seu PC

Open Generative AI: um repositório open source que junta mais de 400 modelos de imagem, vídeo, áudio e lip sync numa interface só. Instala em um clique e tem um caminho que roda sem chave de API nenhuma.

As aulas de IA que o Google liberou de graça
Resgatar material →

As aulas de IA que o Google liberou de graça

O mapa das 17 aulas do AI Boost Bites: o que cada uma ensina, por onde começar e os prompts pra aplicar no mesmo dia. Direto do Google Skills, com badge oficial no fim de cada uma.

As regras de design da Apple viraram uma skill do Claude Code
Resgatar material →

As regras de design da Apple viraram uma skill do Claude Code

A skill apple-design destila as talks de design da Apple e traduz pra web. Aqui está como instalar, o prompt que audita o site que você já tem, e os números concretos que ela carrega dentro.

As 25 trocas: ferramenta paga que tem versão grátis
Resgatar material →

As 25 trocas: ferramenta paga que tem versão grátis

A lista completa do carrossel, com o link direto de cada alternativa gratuita e o que ela entrega de verdade. Mais o teste de uma semana que decide o que você cancela e o que continua valendo a pena pagar.

Os servidores MCP que valem instalar (e o que evitar)
Resgatar material →

Os servidores MCP que valem instalar (e o que evitar)

MCP é o USB-C da IA: um padrão só que pluga o Claude em qualquer ferramenta. Separei os que valem instalar primeiro, por perfil, com o comando de instalação de cada um.

O Prompt da Verdade
Resgatar material →

O Prompt da Verdade

Uma instrução que você cola uma vez nas configurações do Claude, ChatGPT ou Gemini e força a IA a separar fato de chute, e avisar quando não sabe.

As 5 skills de animação pro Claude Code
Resgatar material →

As 5 skills de animação pro Claude Code

Os repositórios que dão pro Claude Code o contexto certo de cena 3D, timeline, motion design e acabamento visual. Links diretos, é só clonar e usar.

O repositório com 100+ agentes de IA prontos pra copiar
Resgatar material →

O repositório com 100+ agentes de IA prontos pra copiar

128 mil estrelas, licença Apache 2.0 e mais de 100 agentes, skills e apps de RAG testados de ponta a ponta. Você clona, roda em 4 comandos e pode usar comercialmente, sem construir nada do zero.

O router grátis que acaba com o rate limit do seu Claude Code
Resgatar material →

O router grátis que acaba com o rate limit do seu Claude Code

Um gateway open source que conecta Claude Code, Cursor, Codex e Cline a mais de 60 provedores de IA com fallback automático: sua assinatura acaba, ele troca sozinho pro plano barato ou de graça e você nunca para de codar.

O plugin que audita seu Claude Code e recomenda o setup certo
Resgatar material →

O plugin que audita seu Claude Code e recomenda o setup certo

Plugin oficial da Anthropic que lê o seu projeto e devolve as automações (hooks, skills, subagents, MCPs) que fazem sentido pro SEU código. Só análise, não mexe em nada.

As 3 camadas do CLAUDE.md
Resgatar material →

As 3 camadas do CLAUDE.md

Computer, Project e Folder: os arquivos que fazem o Claude parar de esquecer como você trabalha, sessão após sessão. Com os 3 templates reais pra copiar e o prompt que preenche sozinho.

O loop que economiza o Fable 5
Resgatar material →

O loop que economiza o Fable 5

Como usar o modelo mais forte do Claude (Fable 5 ou Opus 4.8) só pra planejar e revisar, enquanto um subagente barato faz o trabalho pesado, sem estourar o limite de uso.

O playbook de segurança com IA
Resgatar material →

O playbook de segurança com IA

3 prompts prontos pra vetar skills antes de instalar, travar suas chaves de API e criar guardrails antes de conectar qualquer ferramenta na sua IA.

5 usos insanos do Fable 5
Resgatar material →

5 usos insanos do Fable 5

Os 5 usos do Fable 5 (o modelo mais forte do Claude) que eu já testei essa semana, com os prompts prontos pra copiar e colar.

As 5 skills que transformam o Claude Code numa máquina
Resgatar material →

As 5 skills que transformam o Claude Code numa máquina

O Claude Code tem mais de 100 mil skills, mas são essas 5 que fazem a diferença de verdade. Com o repositório oficial e o comando de instalação de cada uma.

O estúdio de voz com IA que roda de graça na sua máquina
Resgatar material →

O estúdio de voz com IA que roda de graça na sua máquina

Clona qualquer voz, gera fala em 23 idiomas e dita em qualquer app, tudo rodando local e open source. Substitui o ElevenLabs e o Whisperflow sem mensalidade.

As 42 skills que consertam o design do Claude
Resgatar material →

As 42 skills que consertam o design do Claude

Por padrão o Claude entrega design genérico. Pluga as skills certas e ele vira uma máquina de UI impecável. Aqui estão as 42, em 6 camadas, com o comando de instalação de cada uma.

A planta do seu segundo cérebro
Resgatar material →

A planta do seu segundo cérebro

Junta a inteligência do Claude com o vault conectado do Obsidian: pensa mais fundo, conecta melhor e executa mais rápido.

✕ Fechar

✦ Felipe Tâmbara · IA na prática

O modelo não precisa caber na sua memória. Precisa caber no seu disco

1

O que é isso, sem enrolação

2,78 trilhões de parâmetros. Um CPU. 8,24 GB de RAM.

A ideia: kimi-k3-in-c é um motor de inferência escrito em C99 puro que roda o Kimi K3, o modelo de 2,78 trilhões de parâmetros da Moonshot AI, num único CPU. Sem GPU, sem framework, sem BLAS, sem CUDA, sem PyTorch. O binário compilado inteiro pesa 176 KB, e o pico de memória medido é 8,24 GB. O autor é o Fareed Khan, e o projeto saiu sob licença Apache 2.0.
  1. AO checkpoint tem 1,56 TB. Esse é o pedágio real, e ele é de disco, não de placa de vídeo.
  2. B93% desse arquivo nunca entra na memória. Ele é lido direto do NVMe, com O_DIRECT, no momento exato em que é necessário.
  3. COs números não são estimativa. Todos os valores do repositório vêm da saída de medição que está publicada em docs/data/.
Por que isso importa mais do que parece: A conclusão do projeto é uma frase só, e ela muda o jogo mental de quem trabalha com IA: a barreira para rodar um modelo de fronteira na sua máquina é um problema de armazenamento, não de computação. Não é a falta de GPU que te impede. É onde os bytes moram.
Repositório FareedKhan-dev/kimi-k3-in-c no GitHubApache 2.0github.com/FareedKhan-dev/kimi-k3-in-c
2

O truque: o disco vira memória

16 de 896 especialistas acendem por vez

Como o modelo cabe: O Kimi K3 é um modelo de especialistas (mixture of experts). Para cada token gerado, só 16 dos 896 especialistas de cada camada são realmente usados. Os outros 880 estão dormindo. O motor aproveita exatamente isso: o tronco denso (as 93 camadas que sempre trabalham) fica na memória até a profundidade que você escolher, e os especialistas adormecidos são lidos do disco na hora, já multiplicados direto no formato empacotado de 4 bits, sem descompactar.
Tronco denso93 camadas que sempre rodam. Reempacotadas num arquivo de 109 GB onde cada camada é lida em uma única chamada.
Especialistas1,45 TB que nunca ficam residentes. Streaming do NVMe com O_DIRECT, multiplicados no formato de 4 bits.
Cache LRUGuarda os especialistas mais requisitados. O tamanho ideal foi decidido por medição, não por chute.
Resultado8,24 GB de pico de memória para um checkpoint de 1,56 TB.
A parte contraintuitiva: Empacotar o tronco em um arquivo com deslocamento conhecido por camada é o que transforma a exigência de memória num botão de ajuste. Antes disso, era um piso fixo: ou cabia, ou não rodava. Depois disso, virou uma escolha sua.
3

A mesma resposta em qualquer máquina

Mais RAM compra velocidade, nunca qualidade

O ponto que quase ninguém percebe: O mesmo modelo roda em 8 GB e em 224 GB e produz saída idêntica byte a byte em todos os orçamentos entre os dois. Isso não é "quase igual", é literalmente o mesmo texto. A única coisa que muda é o relógio. Você não está trocando qualidade por hardware, está trocando tempo por hardware.
Notebook comum, 8 GB26,5 s por token. O modelo inteiro é lido do disco a cada passo.
Notebook top, 32 GB24,2 s por token. Parte do modelo já mora na memória.
Desktop, 64 GB19,8 s por token. Mais uma fatia residente.
Workstation, 128 GB ou mais5,6 s por token. Tudo na memória, a espera do disco acabou.
Honestidade que o próprio autor pratica: Isso é prova de conceito, e é genuinamente lento. O repositório não esconde: dezenas de segundos por token. Ninguém vai botar isso em produção amanhã. O valor aqui não é a velocidade, é a demonstração de que o limite que todo mundo aceita como natural não era o limite que a gente pensava.
4

Rode o motor inteiro em um minuto, sem baixar nada

Sem checkpoint, sem rede, sem Python, sem GPU

Essa é a parte que você faz agora: Você não precisa dos 1,56 TB para ver a coisa funcionando. O repositório traz um teste completo que valida cada núcleo do motor, o cache de streaming, o leitor de safetensors, o leitor de configuração e o tokenizador contra uma referência em PyTorch, usando um modelo de 13 camadas com o mesmo grafo de tensores do modelo real. Roda em menos de um minuto, offline.
Clone, compile e valide (leva cerca de um minuto)
git clone https://github.com/FareedKhan-dev/kimi-k3-in-c.git
cd kimi-k3-in-c

make -j            # segundos. Sete arquivos C, um compilador e OpenMP
make test          # menos de um minuto
Se terminar assim, passou: GATE 1 teacher forcing · GATE 2 greedy decode · GATE 3 incremental, e no fim VERDICT: ENGINE MATCHES THE REFERENCE EXACTLY. Se não terminar assim, falhou. É esse tipo de portão binário que separa um projeto sério de uma demonstração bonita.
A ordem importa: Rodar o make test antes de baixar 1,56 TB é a decisão inteligente do projeto. Você prova que o motor bate com a referência usando só o repositório, e só depois decide se quer gastar horas de download.
5

O caminho completo, se você quiser ir até o fim

Seis passos. Só um deles é lento.

  1. APasso 0 e 1, clonar e diagnosticar: ./scripts/k3-doctor.sh checa a cadeia de compilação, mede o seu disco do jeito que o motor lê, escolhe o preset certo pra sua RAM e imprime o próximo comando. Leva cerca de um minuto e sai com erro se a máquina não der conta.
  2. BPasso 2 e 3, compilar e validar: make -j e make test. As únicas dependências são um compilador C99, libm e OpenMP. CMake também funciona.
  3. CPasso 4, baixar o checkpoint: 1,56 TB, então horas e não minutos. Precisa de um token do Hugging Face. O script é retomável: rodar de novo continua de onde parou.
  4. DPasso 5, empacotar o tronco: cerca de quatro minutos, uma vez só. Reescreve as 93 camadas densas num arquivo de 109 GB. É esse passo que transforma a memória num botão de ajuste. Coloque a saída no disco mais rápido que você tiver.
  5. EPasso 6, rodar: o tokenizador vem junto com o checkpoint, por isso o --tok aponta pra pasta do modelo.
Baixar e empacotar
export HF_TOKEN=hf_seu_token_aqui
./scripts/download-model.sh ~/k3model     # retomável, rode de novo pra continuar
./scripts/pack-trunk.sh ~/k3model ~/k3trunk
Gerar texto
./bin/k3 ~/k3model --trunk ~/k3trunk --preset workstation \
         --tok ~/k3model --prompt "The capital of France is" --gen 8 --incremental
Cuidado com o download parcial: Download incompleto não falha com barulho, ele produz tokens errados. O script verifica a contagem de fragmentos, o total exato de bytes e o tamanho de cada um dos 96 fragmentos contra os valores publicados. Se der FAIL, pare. Verificar fragmento por fragmento também transforma "baixar 1,56 TB de novo" em "baixar de novo este arquivo de 17 GB".
6

Escolher o preset certo

O preset é só um atalho para dois números

laptop3 GB de tronco, 1 GB de cache. Pico de 8,2 GB. É o chão. Roda, devagar.
desktop16 GB de tronco, 10 GB de cache. Pico de 31,9 GB.
workstation60 GB de tronco, 30 GB de cache. Pico de 95,5 GB. O cache de especialistas começa a pesar aqui.
server110 GB de tronco, 13 GB de cache. Pico de cerca de 128 GB, com 90 das 93 camadas fixadas. O mais rápido.
max110 GB de tronco, 109 GB de cache. Pico de cerca de 224 GB.
  1. A`max` não é mais rápido que `server` nas medições. Os 96 GB a mais não compram nada além de ruído.
  2. BDê memória ao tronco antes de dar ao cache de especialistas. Com um orçamento fixo de 128 GB, essa escolha valeu 1,69 vezes de desempenho.
  3. CTodos os presets fazem streaming do tronco, então todos precisam do --trunk apontando pra pasta empacotada.
7

O que dá errado, e por quê

As armadilhas que o próprio autor documentou

A memória fica em 113 GB mesmo no preset pequenoVocê esqueceu o --trunk. Sem a pasta empacotada, o tronco inteiro carrega residente e o preset não serve pra nada.
A velocidade está muito abaixo da tabelaQuase sempre é armazenamento. Volume de rede roda várias vezes mais devagar que NVMe local. Mantenha o ~/k3trunk no disco local.
Prompt com acento sai estranhoO shell reescreve os bytes do argv. Ponha o texto num arquivo e use --prompt-file, que é lido literalmente.
Ele recusou de largada por causa do contextoCada posição de contexto custa cerca de 2,37 MB. O motor calcula isso na entrada em vez de descobrir uma hora depois. Encurte o pedido.
Estou no macOS ou no WindowsO motor mira Linux x86-64 (usa O_DIRECT). O tokenizador e o leitor de configuração são C99 portáveis e compilam em qualquer lugar.
Precisa mesmo dos 1,56 TB? Para gerar texto, sim. Para estudar e desenvolver, não: o make test não precisa de nada, e a opção --layers N roda contra conjuntos parciais de fragmentos. Ou seja, dá pra aprender a arquitetura inteira sem baixar um terabyte.
8

As outras 5 da lista

Os links prometidos, com o que a fonte oficial diz

Antes de cada link, uma observação: Cada uma dessas cinco foi conferida em fonte independente, não copiada de vídeo. Onde o número que circula por aí não bate com o que a fonte oficial diz, eu marquei. Ferramenta nova é onde mais se repete informação errada, porque todo mundo copia do mesmo post.
  1. A6. Pocket TTS, da Kyutai. Modelo de voz de 100 milhões de parâmetros que clona voz a partir de um trecho curto de referência e roda no processador do seu notebook, sem placa de vídeo e sem conta em nuvem. Aberto e sem restrição de licença. O detalhe que quase ninguém menciona: o modelo ganhou versão multilíngue, com português incluído, o que muda completamente o que dá pra fazer com ele aqui.
  2. B5. Hermes Skills Hub, da Nous Research. Registro de skills para o Hermes Agent, com mais de 90 mil skills espalhadas por dezenas de registros, instaláveis direto no agente. O ponto que interessa a quem vai usar de verdade: todas as skills instaladas pelo hub passam por um scanner de segurança que procura vazamento de dados, injeção de prompt, comando destrutivo e sinal de ataque de cadeia de suprimento. Instalar skill de terceiro sem essa checagem é o furo de segurança mais fácil de cometer hoje.
  3. C4. Grok Imagine Image 2.0, da xAI. Publicado em 7 de agosto de 2026. Você aponta para uma região da imagem e muda só aquele pedaço, sem mexer no resto. Tem remoção de fundo com transparência limpa, aceita até 5 imagens de referência numa geração só e redimensiona de forma inteligente. A xAI reporta segunda posição mundial tanto em geração quanto em edição de imagem, com o gpt-image-2 da OpenAI em primeiro.
  4. D3. Muse Code, da Meta. Agente de código de terminal, em beta desde 5 de agosto de 2026, movido pelo Muse Spark 1.2. Mantém agentes de fundo vivos a sessão inteira, acumulando contexto em vez de recomeçar do zero, e abre subagentes em worktrees isoladas do git, então a sua cópia de trabalho nunca é tocada. Atenção ao que o hype omite: ele não é grátis. Custa por token, e existe uma faixa muito mais barata para quem autoriza a Meta a treinar no seu código. Se o código é de cliente, essa faixa não é uma opção, é um problema de contrato.
  5. E2. Qwen3.8-Max, da Alibaba. 2,4 trilhões de parâmetros com apenas 95 bilhões ativos por inferência (arquitetura esparsa de especialistas) e janela de contexto de 1 milhão de tokens. É a primeira vez que a Alibaba libera pesos abertos de um modelo da classe Qwen-Max. Uma correção sobre o que circula: ele aparece em quinto no Text Arena e segundo no Vision Arena, então a alegação de "melhor modelo chinês do mundo" depende muito de qual placar você está olhando.
Pocket TTS, da Kyutaiabertokyutai.orgHermes Skills Hub, da Nous Researchgrátishermes-agent.nousresearch.com/docs/user-guide/features/skills/Grok Imagine Image 2.0, da xAIanúncio oficialx.ai/news/grok-imagine-image-2Muse Code, da Metapago, betatechcrunch.com/2026/08/05/meta-launches-muse-code-an-ai-agent-for-large-code-bases/Qwen3.8-Max, da Alibabapesos abertosalibabagroup.com/en-US/document-2021044032125272064
Como ler uma semana dessas: Cinco lançamentos numa semana e nenhum deles muda a sua vida sozinho. O que muda é reparar no padrão: três dos seis itens dessa lista existem para tirar trabalho da nuvem e devolver pra sua máquina (o Kimi em C, o Pocket TTS e as worktrees locais do Muse Code). Quando a mesma direção aparece em times que não conversam entre si, isso não é moda, é para onde o custo está indo.
9

O que fazer com essa informação

A lição não é o modelo, é o método

Onde isso te serve mesmo sem 1,7 TB de disco livre: A pergunta que esse projeto responde não é "como eu rodo o Kimi K3". É "por que eu aceitei que precisava de uma GPU?". Quatro decisões sobre onde os bytes moram levam a coisa de um cluster para um notebook, com a mesma resposta nas duas pontas. Esse tipo de raciocínio, mover trabalho de onde é caro para onde é barato, é exatamente o que separa quem monta sistema de IA que se paga de quem só paga API.
  1. ALeia a Parte II do repositório. Ela reconstrói cada caixa dos dois diagramas, um componente por vez. É material de estudo de arquitetura, não só um README.
  2. BRepare no padrão dos portões. O projeto valida contra um oráculo minúsculo primeiro, depois contra o checkpoint completo. Dá pra copiar essa disciplina pra qualquer sistema que você construa.
  3. CGuarde a conclusão: armazenamento é o jogo inteiro. Quando o gargalo muda de lugar, a solução muda de lugar junto.
Aqui é onde isso para de ser curiosidade: Ler um repositório assim é fácil. Difícil é olhar pro processo de um cliente e enxergar onde está o gargalo real, o equivalente ao "o problema é disco, não GPU" do negócio dele. Essa é a planta base. Como transformar leitura técnica em sistema que fatura é o que eu mostro por dentro da mentoria.
Repositório completo, com as Partes II a Vgrátisgithub.com/FareedKhan-dev/kimi-k3-in-c

✦ Material parado não muda nada

Pegou o passo a passo. E agora?

Material salvo que você nunca executa não muda nada. O que falta não é conteúdo, é gente construindo do seu lado. Na Core, a comunidade de builders, você aplica isso junto com quem tá fazendo o mesmo, com as aulas e o suporte pra destravar de verdade.

Conhecer comunidade →