Pergunta clássica de AI / LLM Engineering em processo gringo. Não decore palavra por palavra: entenda a estrutura da resposta e refaça com as suas palavras, em inglês.
A multi-armed bandit algorithm ("bandit" = choosing between options with unknown payoffs, like slot machines) to pick the best variant (prompt A/B/C) while still learning.
Each variant keeps a success-probability distribution based on its wins and losses so far. Per request: SAMPLE a value from each distribution, pick the highest. Winners naturally get more traffic; losers still get occasional exploration.
vs a fixed A/B split: converges faster and wastes less traffic on losers.
Say it simple: "explore vs exploit, solved with probability."
Ler é fácil. Falar isso em inglês, sob pressão, com alguém avaliando, é outra história. No VagaGringa esse tópico vira flashcard com repetição espaçada, cai em quiz e entra no simulado.
Treinar este tópico no app