Skills: Otimização de Performance
Última atualização: 2026-08-31
Uma Skill rápida é uma alegria de usar; uma lenta é um tormento — performance determina com que frequência uma Skill é usada.
1. Gargalos de Performance
(1) Análise de Gargalos
| Gargalo | Impacto | Direção de Otimização |
|---|---|---|
| Contexto longo | Resposta lenta, custo alto | Comprimir contexto |
| Muitas chamadas de ferramenta | Duração longa, desperdício de tokens | Mesclar chamadas |
| Prompt verboso | Processamento lento, mais ambiguidade | Simplificar prompt |
| Escopo de busca grande | Resultados imprecisos | Estreitar escopo |
| Operações repetidas | Baixa eficiência | Cachear resultados |
(2) Métricas de Performance
Indicadores de Performance de Skill
├── Tempo de resposta: Tempo da invocação até a primeira saída
├── Contagem de chamadas de ferramenta: Número de invocações em uma execução
├── Consumo de tokens: Total de tokens de entrada + saída
├── Precisão: Proporção da saída que atende às expectativas
└── Taxa de conclusão: Proporção de tarefas concluídas com sucesso
2. Otimização de Prompt
(1) Princípios de Simplificação
Três Princípios de Simplificação de Prompt
├── Deletar: Remover explicações redundantes e exemplos excessivos
├── Mesclar: Combinar regras similares em descrições unificadas
└── Comprimir: Usar tabelas ao invés de descrições de texto longo
(2) Comparação de Exemplos
Versão verbosa:
Ao revisar código por favor verifique a segurança. Segurança inclui injeção SQL, XSS,
CSRF e outras vulnerabilidades comuns. Também verifique se informações sensíveis estão
hardcoded no código. Também verifique se bibliotecas de dependências inseguras são usadas......
Versão concisa:
## Verificações de Segurança
- Injeção SQL / XSS / CSRF
- Chaves / tokens hardcoded
- Dependências inseguras
(3) Prompts Estruturados
## Estrutura Recomendada
1. Definição de papel (1 linha)
2. Fluxo de execução (lista ordenada)
3. Dimensões de revisão (tabela)
4. Formato de saída (template)
5. Restrições (lista)
3. Otimização de Chamadas de Ferramenta
(1) Em Lote ao Invés de Sequencial
Ineficiente:
Read arquivo1.py → Read arquivo2.py → Read arquivo3.py
(3 chamadas de ferramenta)
Eficiente:
Glob "src/**/*.py" → Read seletivamente arquivos-chave
(1 + 2 = 3 chamadas, mas mais direcionadas)
(2) Busca ao Invés de Travessia
Ineficiente:
Read todos os arquivos → Verificar um por um por alvos
Eficiente:
Grep "class.*Service" → Read apenas arquivos correspondentes
(3) Incremental ao Invés de Completo
Ineficiente:
Read todos os arquivos do projeto para cada revisão
Eficiente:
Read apenas arquivos alterados no git diff
4. Otimização de Contexto
(1) Orçamento de Contexto
Estratégia de Alocação de Contexto (orçamento total de 200K tokens)
Prompt da Skill: 5K (2,5%)
Contexto do projeto: 10K (5%)
Saída de ferramenta: 80K (40%)
Histórico de conversa: 50K (25%)
Espaço reservado: 55K (27,5%)
(2) Estratégia de Sumarização
| Conteúdo Original | Método de Sumarização | Taxa de Compressão |
|---|---|---|
| Arquivos completos | Assinaturas de função + linhas-chave | 10:1 |
| Resultados de busca | Linhas correspondentes + caminhos | 5:1 |
| Logs de erro | Tipo de erro + topo da pilha | 8:1 |
| Histórico de conversa | Resumo de registro de decisões | 20:1 |
(3) Carregamento Preguiçoso
## Estratégia de Carregamento Preguiçoso
1. Não pré-carregar todos os arquivos do projeto
2. Usar Glob/Grep para localizar primeiro
3. Read apenas arquivos necessários
4. Evitar ler recursivamente cadeias de dependência
5. Prática de Otimização de Performance
▶ Exemplo: Otimizando uma Skill de Revisão
Alice comparou sua Skill de revisão antes e depois da otimização:
Antes:
- Prompt de 3000 palavras → Processamento lento, mais ambiguidade
- Read 10 arquivos um por um → 10 chamadas
- Sem limite de contexto → Alto consumo de tokens
Depois:
- Prompt de 800 palavras (tabela) → Processamento rápido, claro
- Grep para localizar + Read 3 arquivos-chave → 4 chamadas
- Limite de contexto 50K → 60% de redução de tokens
Bob disse: "O núcleo da otimização de performance não é fazer menos — é fazer as coisas certas. Busca direcionada é 10x mais rápida que percorrer todos os arquivos."
❓ Perguntas Frequentes
P: Prompts mais curtos reduzem a qualidade? R: Não necessariamente. A chave é especificidade e clareza, não comprimento. Prompts estruturados concisos frequentemente superam ensaios verbosos. P: Como equilibrar precisão e performance? R: Garantir precisão para etapas principais; otimizar performance para etapas auxiliares. Dimensões de revisão não podem ser cortadas, mas escopo de busca pode ser estreitado. P: Como monitorar consumo de tokens? R: Cada plataforma tem estatísticas de uso de tokens. Monitoramento no nível da Skill requer pedir uso de tokens no prompt ou obtê-lo da API da plataforma.
📖 Resumo
- Cinco gargalos: Contexto longo, muitas chamadas, prompt verboso, busca grande, operações repetidas
- Otimização de prompt: Deletar redundância, mesclar similaridades, comprimir estrutura, usar tabelas
- Otimização de ferramenta: Em lote, busca, incremental ao invés de travessia
- Otimização de contexto: Alocação de orçamento, compressão por sumarização, carregamento preguiçoso
📝 Exercícios
- Básico (⭐): Revise seus prompts de Skill existentes, removendo conteúdo redundante mantendo a eficácia.
- Intermediário (⭐⭐): Otimize a cadeia de chamadas de ferramenta de uma Skill, usando busca ao invés de travessia, comparando contagens de chamadas antes e depois.
- Avançado (⭐⭐⭐): Projete um plano de benchmarking de performance de Skill, comparando quantitativamente tempo de resposta, consumo de tokens e precisão antes e depois da otimização.