Cada ferramenta na sua camada
O pipeline parece complexo até você ver que é só cada etapa na camada certa. A LLM faz pouco, e por isso o pipeline é barato e estável.
Todo trabalho com dado é um ETL: extrai, transforma, carrega. O erro caro é resolver tudo com LLM. A hierarquia de camadas coloca cada etapa onde ela custa menos e entrega mais: script, serviço ou IA.
Use este mapa para entender a sequência da aula antes de entrar nos detalhes.
Cada etapa do ETL tem uma camada natural. Script para o que é regra, serviço para o que uma ferramenta já resolve, LLM para o que exige interpretação. A regra é descer a camada sempre que possível: ela é mais barata e mais confiável.
Três movimentos: entender as 3 camadas, ver o pipeline Whisper mais Pandoc mais Calibre mais LLM ao vivo, e desenhar um ETL seu com a hierarquia certa.
O desenho de um pipeline ETL seu, com cada etapa colocada na camada certa.
Você tem o mapa. Agora vê o pipeline real montado camada por camada.
Caso RealAlan montou um pipeline de conteúdo onde cada ferramenta faz uma camada: Whisper transcreve, Pandoc e Calibre convertem, e a LLM só interpreta no fim. A IA fica leve porque as camadas abaixo carregam o peso.
O pipeline parece complexo até você ver que é só cada etapa na camada certa. A LLM faz pouco, e por isso o pipeline é barato e estável.
Você viu o pipeline montado. Agora a técnica: a hierarquia formal e a sequência de desenho.
TrilogiaAs 3 camadas que transformam um pipeline tudo-LLM num pipeline em tiers.
Script e serviço são determinísticos: mesma entrada, mesma saída, custo fixo. A LLM varia e cobra token. Descer a camada sempre que der é o que mantém o pipeline barato e confiável.
Tier 0 é o script determinístico. Tier 1 é o serviço especializado (Whisper, Pandoc, Calibre). Tier 2 é a LLM, para interpretação e julgamento. Cada etapa do ETL mora num tier.
Para cada etapa do ETL, pergunte: um script resolve? Um serviço já existe? Só então suba para a LLM. Mapeie cada etapa para o tier mais baixo que a resolve.
Cada tier tem um tipo de trabalho e um exemplo concreto. A grade que você usa ao desenhar o pipeline.
Transformação determinística feita por código próprio. Regex, parsing, cálculo, renomeação.
Ferramenta especializada que já resolve. Whisper transcreve, Pandoc e Calibre convertem formato.
Interpretação, extração de sentido e julgamento sobre o conteúdo já limpo.
Mandar o áudio direto pra IA parece prático.
Esclareça: O Whisper é um serviço dedicado: transcreve melhor, mais barato e sem variância. A IA entra depois, no conteúdo já transcrito.
Pedir pra IA limpar o texto parece flexível.
Esclareça: Se a limpeza tem regra fixa, um script faz igual sempre. A IA só agrega onde a limpeza depende de interpretação.
Subir tudo pra LLM parece mais poderoso.
Esclareça: A camada baixa é mais barata e estável. Suba só quando a etapa exige julgamento que o tier abaixo não dá.
Os passos concretos para desenhar um pipeline ETL com cada etapa na camada certa.
Use antes de montar qualquer fluxo de transformação de dado.
listar-etapas→perguntar-camada→mapear→subir-so-no-fimlistar-etapas — Liste as etapas do ETL: extrair, tratar, carregar, em detalhe.perguntar-camada — Para cada etapa: um script resolve? Um serviço já existe?mapear — Coloque cada etapa no tier mais baixo que a resolve.subir-so-no-fim — A LLM (Tier 2) entra só nas etapas de interpretação e julgamento.Da etapa à camada certa
extrair, tratar, carregar.
se a regra é clara, Tier 0.
se há ferramenta pronta, Tier 1.
interpretação e julgamento, Tier 2.
Você tem a técnica. Agora a prática: desenhe um pipeline ETL seu em camadas.
PráticaPegue um fluxo de dado seu e desenhe o ETL colocando cada etapa no tier mais baixo que a resolve.
01# Desenhe antes de montar. Desca a camada sempre que der.02pipeline: "{nome do fluxo de dado}"03etapas:04- etapa: "{o que esta etapa faz}"05tipo: "{extrair | tratar | carregar}"06script_resolve: "{sim | nao}"07servico_pronto: "{qual ferramenta, ou nenhuma}"08tier: "{tier0-script | tier1-servico | tier2-llm}"09justificativa_llm: "{se tier2: qual interpretacao so a IA da}"
Os termos desta aula em uma frase cada.
Fluxo de extrair, transformar e carregar dado. Toda tarefa com dado é um ETL.
A camada determinística: transformação feita por código próprio com regra clara.
A camada de ferramenta especializada que já resolve (Whisper, Pandoc, Calibre).
A camada de interpretação e julgamento, onde a IA agrega o que as camadas abaixo não dão.
A regra de colocar cada etapa no tier mais baixo que a resolve, subindo só quando precisa.