Conceitos de IA Avançados
Guia prático com explicações, exemplos reais e aplicações de 14 conceitos essenciais para desenvolvedores e arquitetos que trabalham com sistemas de Inteligência Artificial em produção.
RAG — Retrieval-Augmented Generation
Dados & BuscaRAG é uma arquitetura que combina busca semântica com geração de texto. Em vez de depender apenas do conhecimento interno do LLM (que é estático e limitado pela data de corte), o sistema recupera documentos relevantes em tempo real e os insere no contexto da requisição antes de gerar a resposta.
Sem RAG: o LLM não conhece esses documentos e alucina respostas.
Com RAG: a pergunta
"Como calibrar o sensor modelo X-200?" gera um embedding
→ busca no vector DB → recupera as 3 páginas mais similares do manual
→ LLM responde com base no conteúdo real do documento.
Embeddings Vetoriais e Vector Databases
Dados & BuscaEmbeddings são representações numéricas de texto (ou imagem, áudio) em um espaço vetorial de alta dimensão (ex: 1536 dimensões). Textos semanticamente similares ficam próximos nesse espaço. O modelo de embedding converte qualquer texto em um vetor que captura seu significado.
"cachorro" e "cão" ficam muito próximos no espaço vetorial."banco de dados" e "base de dados" ficam próximos."banana" e "banco de dados" ficam distantes.
Bancos de dados especializados em armazenar e buscar vetores por similaridade (distância coseno ou L2), em vez de busca por palavra-chave exata (SQL LIKE).
🌲 Pinecone
Managed, serverless, muito fácil de usar. Ideal para protótipos e produção rápida.
🕸️ Weaviate
Open-source, suporta busca híbrida (vetorial + keyword). Auto-hospedado ou cloud.
🐘 pgvector
Extensão do PostgreSQL. Sem infraestrutura nova — ideal se já usa Postgres.
🔵 Qdrant
Open-source, muito rápido, suporta filtros avançados junto com busca vetorial.
Agentes de IA (Agentic AI)
Agentes & OrquestraçãoUm agente de IA é um sistema onde o LLM não só gera texto — ele decide qual ação tomar, executa ferramentas, observa o resultado e itera até concluir a tarefa. O ciclo fundamental é: Perceber → Raciocinar → Agir → Observar.
🔗 Prompt Chaining
Saída de um LLM vira input do próximo. Sequencial, previsível, boa para pipelines fixos.
⚡ Paralelização
Múltiplos agentes executam tarefas simultâneas e os resultados são agregados.
🎯 Orchestrator-Worker
Um LLM coordenador delega subtarefas para agentes especializados.
👤 Human-in-the-loop
O agente pausa e pede aprovação humana antes de ações irreversíveis.
Skills para Agentes de IA
Agentes & OrquestraçãoSkills são capacidades modulares e reutilizáveis que podem ser instaladas em um agente de IA, funcionando como "plugins de comportamento". Cada skill encapsula um conjunto de instruções, ferramentas e exemplos que ensinam o agente a executar um tipo específico de tarefa com qualidade consistente.
Com skill
docx instalada: o agente carrega instruções
especializadas, usa python-docx com padrões corretos, gera headers, TOC
e estilos adequados automaticamente.
Harness em Agentes de IA
Agentes & OrquestraçãoUm harness (ou agent harness) é o scaffolding — a estrutura de controle — que orquestra o loop de execução de um agente. Ele gerencia o ciclo de vida: inicializa o contexto, chama o LLM, intercepta chamadas de ferramentas, executa-as e reinjeta os resultados, repetindo até o objetivo ser alcançado ou um limite ser atingido.
🔄 Loop de execução
Controla quantas iterações o agente pode fazer antes de parar (evitar loops infinitos).
🗃️ Memória e contexto
Mantém o histórico de tool calls e resultados entre cada iteração do loop.
🛡️ Interceptação de tools
Valida, autentica e limita o que o agente pode fazer antes de executar cada tool.
🚨 Erros e retries
Lida com falhas de tool, timeouts e decide se reinicia ou escala para humano.
Claude Agent SDK: SDK oficial da Anthropic para construir harnesses com Claude.
AutoGen: harness multi-agente da Microsoft com suporte a conversas entre agentes.
CrewAI: harness com foco em equipes de agentes com papéis definidos.
MCP — Model Context Protocol
Agentes & OrquestraçãoMCP é um protocolo aberto (criado pela Anthropic) que padroniza como modelos de IA se conectam a ferramentas e fontes de dados externas. Funciona como um "USB para IA": qualquer aplicação que implemente o protocolo MCP pode ser usada por qualquer modelo compatível, sem integrações customizadas.
🖥️ MCP Host
A aplicação de IA (Claude Desktop, IDEs, agentes) que consome as ferramentas.
⚡ MCP Server
O serviço que expõe ferramentas, recursos e prompts. Pode ser local ou remoto.
🛠️ Tools
Funções que o modelo pode chamar: ler arquivos, executar queries, enviar emails.
📚 Resources
Conteúdo que o servidor expõe para o contexto: arquivos, docs, dados ao vivo.
Ao conectar ao Claude Desktop: o Claude pode responder "Quantos usuários ativos temos hoje?" executando automaticamente
SELECT COUNT(*) FROM users WHERE last_seen > NOW() - INTERVAL '24h'
e retornando o resultado — sem você escrever nenhuma linha de código de integração.
SWE-agent e Claude Code
Agentes & OrquestraçãoSWE-agent (Software Engineering Agent) é a categoria de agentes de IA especializados em tarefas de engenharia de software: ler código, editar arquivos, executar testes, depurar erros e submeter Pull Requests de forma autônoma.
Claude Code é a implementação da Anthropic: um agente de desenvolvimento autônomo que roda no terminal, tem acesso ao filesystem, pode executar comandos, instalar dependências e interagir com Git — tudo guiado pelo desenvolvedor via linguagem natural.
Claude Code (autonomamente):
1. Lê todos os arquivos relevantes (
auth/*.py, models/user.py)2. Instala
python-jose via pip3. Edita os arquivos, remove lógica de sessão, implementa JWT
4. Roda
pytest e corrige erros encontrados5. Cria commit com mensagem descritiva
Claude Sonnet 4 (com Claude Code): resolve ~72% dos issues de forma autônoma.
Isso significa corrigir bugs reais em projetos como Django, scikit-learn, Flask.
Guardrails em Sistemas de IA
Qualidade & SegurançaGuardrails são controles técnicos que protegem sistemas de IA em produção — validando o que entra (input) e o que sai (output) para garantir segurança, conformidade e proteção de dados pessoais (PII). São a diferença entre um modelo que pode dizer qualquer coisa e um sistema confiável para uso empresarial.
📥 Input Guardrails
Filtram prompts antes do LLM: detectam injeção de prompt, conteúdo proibido, PII.
📤 Output Guardrails
Validam respostas antes de entregar ao usuário: removem dados sensíveis, verificam formato.
📋 Policy Guardrails
Regras de negócio: o assistente não pode discutir concorrentes, não pode dar preços sem aprovação.
🔒 Safety Guardrails
Bloqueiam conteúdo prejudicial, discriminatório ou ilegal — via classificadores ou regras.
\d{3}\.\d{3}\.\d{3}-\d{2} → mascara antes de enviar ao LLM.Output: LLM gera resposta com dados de treinamento sensíveis → guardrail detecta padrão de cartão de crédito → substitui por
[REDACTED].
Evals — Avaliações Automatizadas de IA
Qualidade & SegurançaEvals (evaluations) são suítes de testes automatizados para medir qualidade, consistência e regressão em sistemas de LLM em produção. Assim como unit tests medem corretude de código, evals medem qualidade de respostas — mas com critérios que podem ser subjetivos ou difíceis de verificar automaticamente.
✅ Evals determinísticos
Assertivas verificáveis: "a resposta contém JSON válido?", "o número retornado é > 0?"
🤖 LLM-as-judge
Um LLM avalia a resposta de outro: "esta resposta é factualmente correta? (sim/não/parcial)"
👤 Human eval
Avaliadores humanos pontuam amostras. Lento mas necessário para validar os outros tipos.
📊 Métricas de referência
BLEU, ROUGE, BERTScore — comparam a saída com uma resposta de referência ideal.
GenAI para Geração de Testes
Qualidade & SegurançaUsar modelos de IA generativa para criar automaticamente casos de teste, testes unitários, testes de integração e dados de teste. O LLM analisa o código-fonte (ou especificação) e gera cobertura de teste que cobriria edge cases que um desenvolvedor poderia não considerar manualmente.
calcular_desconto(preco, cupom)LLM gera:
• Teste com preço zero → espera ValueError
• Teste com cupom expirado → espera desconto 0%
• Teste com desconto > 100% → espera cap em 100%
• Teste com cupom válido → verifica cálculo correto
• Teste com preço negativo → espera ValueError
• Fuzz test com strings aleatórias no campo cupom
GitHub Copilot: sugere testes ao abrir arquivos de test.
Claude Code: escreve toda a suíte de testes de um módulo com um comando.
Diffblue Cover: especializado em Java, gera JUnit tests automaticamente.
Model Routing
Produção & OperaçãoModel Routing é a prática de direcionar cada requisição para o modelo mais adequado com base na complexidade, custo e latência requerida. Em vez de sempre usar o modelo mais caro e poderoso, o sistema classifica a tarefa e escolhe o modelo certo para aquela complexidade específica.
📏 Complexidade da tarefa
Perguntas simples → modelo pequeno. Raciocínio multi-step → modelo grande.
💰 Budget por requisição
Usuário free tier → modelo econômico. Usuário premium → modelo premium.
⏱️ Latência requerida
Interface de chat precisa de resposta em <2s → modelos menores e mais rápidos.
🔧 Especialidade do domínio
Código → modelo especializado em código. Jurídico → modelo fine-tuned jurídico.
LLMOps
Produção & OperaçãoLLMOps é a disciplina de operar, monitorar e versionar sistemas baseados em LLMs em produção. É o MLOps adaptado para as particularidades dos modelos de linguagem: prompts são código, respostas são não-determinísticas, e regressões podem ser sutis e difíceis de detectar.
📝 Prompt versioning
Prompts tratados como código: versionados em Git, testados antes de deploy, rollback disponível.
📊 Observabilidade
Logs de cada LLM call: tokens, latência, custo, input/output. Traces de agentes multi-step.
🧪 Testes contínuos
Suite de evals roda a cada mudança de prompt ou modelo — igual CI/CD para código.
💸 Gestão de custo
Budget por endpoint, alertas de anomalia, otimização de tokens via prompt caching.
Experiments/Evals: PromptFlow, Weave (W&B), Braintrust
Feature flags de prompts: LaunchDarkly + LLM, Statsig
Cost tracking: OpenMeter, LiteLLM Proxy, Portkey
Context Engineering
Produção & OperaçãoContext Engineering é a prática de estruturar deliberadamente o conteúdo da context window para maximizar a qualidade da resposta e minimizar custo. Vai além do "prompt engineering" — é uma disciplina que inclui o que incluir, em que ordem, em que formato e o que omitir do contexto de cada chamada ao LLM.
🗜️ Compressão de histórico
Em vez de manter 50 mensagens completas, sumarize a conversa antiga em 200 tokens.
💾 Prompt caching
Prefixos estáticos (system prompt + docs) em cache: economia de 90% em tokens de input.
📍 Position bias
LLMs prestam mais atenção ao início e fim. Coloque instruções críticas nesses locais.
🏷️ XML tags estruturais
<documents>, <thinking>, <answer> ajudam o modelo a entender a estrutura do contexto.
Métricas DORA e o Impacto de IA no Time
Produção & OperaçãoDORA (DevOps Research and Assessment) são 4 métricas que medem a performance de times de engenharia de software. Definidas pelo Google Cloud após pesquisa com 32.000 profissionais, são o padrão de referência para medir elite performers.
🚀 Deployment Frequency
Com que frequência o time faz deploy em produção. Elite: múltiplos por dia.
⏱️ Lead Time for Changes
Tempo do commit ao deploy em produção. Elite: menos de 1 hora.
🔧 Mean Time to Recovery (MTTR)
Tempo médio para restaurar serviço após incidente. Elite: menos de 1 hora.
❌ Change Failure Rate
% de deploys que causam incidente. Elite: 0-15%.
Lead Time ↓ — Claude Code reduz tempo de implementação de features. Tarefas que levavam 2 dias passam a levar 4 horas.
MTTR ↓ — Agentes de IA para incident response analisam logs, identificam root cause e sugerem fix em minutos, não horas.
Change Failure Rate ↓ — GenAI para geração de testes aumenta cobertura e detecta regressões antes do deploy.