Guia de entrevista · AI / LLM Engineering

How do you optimize LLM cost and latency?

do caderno de estudos · atualizado em 18 de julho de 2026
Para quem vai encarar entrevista de AI / LLM Engineering2 min

Do meu caderno de erros direto pra cá: a explicação que eu levaria pra uma entrevista hoje, em inglês.

A resposta, como você fala na entrevista
  1. Model routing: small/cheap model for simple cases, escalate hard ones to the big model.
  2. Prompt caching: the provider caches the STATIC prefix of your prompt (system prompt, docs) → big cost/latency cut. Static content goes FIRST in the prompt.
  3. Semantic caching: similar question already answered? Return the cached answer (match by embedding similarity).
  4. Streaming: send the answer word-by-word as it's generated. Doesn't cut total time — kills PERCEIVED latency.
  5. Fewer tokens: trim context, cap max_tokens. Tokens ARE the cost.
  6. Batch APIs for non-realtime work (~50% cheaper).

Ler é fácil. Falar isso em inglês, sob pressão, com alguém avaliando, é outra história. No VagaGringa esse tópico vira flashcard com repetição espaçada, cai em quiz e entra no simulado.

Treinar este tópico no app