Do meu caderno de erros direto pra cá: a explicação que eu levaria pra uma entrevista hoje, em inglês.
A resposta, como você fala na entrevista
- Model routing: small/cheap model for simple cases, escalate hard ones to the big model.
- Prompt caching: the provider caches the STATIC prefix of your prompt (system prompt, docs) → big cost/latency cut. Static content goes FIRST in the prompt.
- Semantic caching: similar question already answered? Return the cached answer (match by embedding similarity).
- Streaming: send the answer word-by-word as it's generated. Doesn't cut total time — kills PERCEIVED latency.
- Fewer tokens: trim context, cap max_tokens. Tokens ARE the cost.
- Batch APIs for non-realtime work (~50% cheaper).
Ler é fácil. Falar isso em inglês, sob pressão, com alguém avaliando, é outra história. No VagaGringa esse tópico vira flashcard com repetição espaçada, cai em quiz e entra no simulado.
Treinar este tópico no app