From PWDEV DevOps — Plataforma, Operação e Incidente
Infraestrutura para IA — GPU, servidores MCP, gateway de LLM, pipeline de inferência, custo de token, cache semântico e observabilidade de modelo. Use quando o usuário disser "GPU", "MCP server", "LLM", "inferência", "modelo", "gateway de IA", "custo de token", "rate limit da API de IA", "self-host de modelo".
How this skill is triggered — by the user, by Claude, or both
Slash command
/pwdev-devops:ai-infraThe summary Claude sees in its skill listing — used to decide when to auto-load this skill
Você opera a camada de IA como qualquer outra dependência de produção — com
Você opera a camada de IA como qualquer outra dependência de produção — com limite, custo, observabilidade e plano para quando ela cair.
API de LLM é dependência externa, cara e instável. Trate como trata banco de terceiro: timeout, retry com backoff, fallback e teto de gasto.
Diferente de outros serviços, o custo aqui é por uso e sem teto natural. Um loop com bug pode gastar em uma hora o orçamento do mês.
Controles mínimos:
Rate limit do lado do provedor não protege seu orçamento — ele só protege o provedor. O teto precisa estar do seu lado também.
| Tipo | Ganho | Quando |
|---|---|---|
| Exato | maior | pergunta repetida literalmente |
| Semântico | alto | pergunta equivalente com outras palavras |
| Prompt cache do provedor | médio | prefixo grande e estável |
Cache é a maior alavanca de custo em IA, e a menos implementada.
nvidia-smi
nvidia-smi --query-gpu=utilization.gpu,memory.used,memory.total --format=csv
| Sintoma | Causa provável |
|---|---|
| OOM na GPU | batch grande, modelo não cabe, fragmentação |
| GPU ociosa com fila | gargalo no pré-processamento ou no I/O |
| Throughput baixo | batch pequeno demais, sem quantização |
GPU é o recurso mais caro por hora da infraestrutura. Ociosa é desperdício direto — meça utilização antes de comprar mais.
Tratando MCP como serviço de produção:
Servidor MCP roda com as credenciais que você der. Um MCP comprometido tem o acesso que você concedeu. Conceda o mínimo.
Vale quando há mais de um provedor ou mais de uma aplicação:
Além de latência e erro, meça:
observability · finops · kubernetes-platform · devsecops · performance-engineer
npx claudepluginhub pwdev-solucoes/pwdev-claude-marketplace --plugin pwdev-devopsGuides completion of development work by verifying tests, detecting environment, and presenting structured options for merge, PR, or cleanup.
Enforces test-driven development: write failing test first, then minimal code to pass. Use when implementing features or bugfixes.
Guides creation and editing of skills using test-driven development with pressure scenarios and subagents to verify agent compliance.