O que é token em IA e por que ele define o seu custo
Entenda o que é token em IA, como contar tokens de um texto em português e calcular o custo em reais de uma chamada de API com preços oficiais datados.
Conteúdo
Código que roda, números reais e o trade-off explícito de quando não usar. Filtre por categoria, nível ou tag.
Entenda o que é token em IA, como contar tokens de um texto em português e calcular o custo em reais de uma chamada de API com preços oficiais datados.
Como usar o Claude Code no dia a dia: instalação, CLAUDE.md, subagentes, hooks, revisão de diff, custos com fonte e o que nunca delegar.
Crie um servidor MCP em Python com duas ferramentas, teste com o cliente do SDK oficial e conecte ao Claude Code ou ao Claude Desktop, com cuidados de segurança.
Faça sua primeira chamada à API da Anthropic em Python, monte um chatbot com memória de conversa e teste tudo sem gastar nada, com modelo local opcional.
Suba o n8n com Docker, importe um fluxo que recebe contatos por webhook, classifica e grava em CSV, e ligue um nó de IA opcional.
Entenda o que é embedding, como o texto vira números que representam significado, e rode em Python uma busca por sentido com um modelo local, sem API paga.
Entenda o que é um LLM, como ele prevê a próxima palavra, por que alucina e o que são treino, parâmetros e janela de contexto, com um exemplo em Python.
Entenda o que é inteligência artificial, como ela aprende com exemplos e onde você já usa IA todo dia, sem jargão e sem precisar saber programar.
Compare quatro estratégias de chunking para RAG com código: tamanho fixo, parágrafo, recursiva e semântica. Veja quando usar cada uma e como medir.
Use pgvector no Postgres como banco vetorial para RAG: tabela, índice HNSW, busca por similaridade, busca híbrida e quando migrar para algo dedicado.
A janela de contexto tem custo e limite. Veja carregamento pontual, roteadores, memória em arquivo e compactação para um agente mais barato e preciso.
Rode um LLM local com Ollama: instale, chame pela API HTTP, entenda quantização e memória necessária e saiba quando local compensa mais que uma API.
Aprenda function calling (tool use) com código: declare ferramentas em JSON Schema, rode o loop de chamadas, valide argumentos e confirme ações críticas.
Implemente guardrails de saída para LLM: schema com Pydantic, retry com feedback do erro, detecção de dados pessoais (CPF, cartão) e fallback seguro.
Monte evals para sua aplicação com LLM: conjunto de casos, métricas determinísticas, LLM como juiz e um gate no CI que barra regressões antes do deploy.
Aprenda a usar Docker multi-stage para reduzir imagens de centenas de MB, com cache de camadas, .dockerignore, usuário não-root e escolha da imagem base.
Monte um pipeline CI/CD com GitHub Actions: lint, testes em matriz, build de imagem Docker, cache, secrets, permissões mínimas e deploy com aprovação.
Aprenda a ler o EXPLAIN ANALYZE, criar os índices certos no Postgres, caçar N+1 no ORM e usar pooling para parar de sofrer com queries lentas.
Implemente cache com Redis do jeito certo: cache-aside, invalidação, TTL com jitter e proteção contra cache stampede, com código Python que roda.
Tire tarefas lentas da requisição HTTP com filas e workers. Veja idempotência, retry com backoff e jitter, DLQ e como monitorar a fila, com Celery e BullMQ.
Instrumente uma API com Prometheus, escreva PromQL para latência, erros e tráfego, monte alertas sem ruído e evite explodir a cardinalidade das métricas.
Aprenda RAG na prática em Python: chunking, embeddings, busca no Chroma e prompt final, mais os erros que fazem o retriever devolver lixo.
Entenda de onde vem o custo de IA, de tokens a GPU ociosa, e aplique as alavancas que mais reduzem a conta: roteamento de modelos, cache, batch, tags e orçamento.
Aprenda engenharia de prompt para produção: estrutura em blocos, exemplos, saída em JSON validada, conjunto de testes e versionamento do prompt.
Traduza seu docker-compose.yml para Kubernetes: Deployment, Service, ConfigMap, Secret, volumes e probes, e entenda por que depends_on não existe.
Saiba quando usar prompt, RAG ou fine-tuning em projetos com LLM. Um guia de decisão com critérios, exemplos e armadilhas para não gastar meses à toa.
Serverless ou containers para IA? Veja quando cada um compensa, os limites do Lambda com modelos, o cold start e como montar uma arquitetura híbrida com fila.
Aprenda a montar agentes de IA em produção: loop com ferramentas, limites de passos e custo, detecção de repetição, tratamento de falhas e rastreio.
Aprenda Terraform do zero: init, plan, apply e destroy, state remoto, variáveis e outputs, com um exemplo de servidor na AWS descrito em código.
Monte a observabilidade de uma aplicação com LLM: registre tokens, custo, TTFT e recusas, avalie qualidade por amostragem e responda 'por que o custo subiu?'.
Entenda o piso físico da latência, calcule o RTT mínimo, meça com curl e use CDN, edge functions, roteamento por latência e réplicas de leitura.
Entenda a segurança em aplicações com LLM pelo OWASP Top 10 (2025): prompt injection, vazamento, agência excessiva, saída insegura e consumo sem limite.
Entenda o viés em modelos de IA: de onde vem, como medir com métricas de fairness por grupo, por que elas conflitam e como corrigir com cuidado e dentro da LGPD.