Pipelines de áudio e vídeo com IA
Mídia é o tipo de carga que quebra projeto de IA: arquivo pesado, processamento demorado, custo por item que sobe rápido e usuário esperando. Isso não se resolve com uma chamada de API, se resolve com fila, worker e medição.
Onde esses projetos costumam morrer
O primeiro erro é processar dentro da requisição do usuário: o arquivo é grande, o processamento leva minutos, e a conexão cai antes de terminar. O segundo é não medir: cada minuto de áudio e cada segundo de vídeo gerado tem preço, e sem contagem por item a fatura chega antes do aprendizado.
O terceiro é mais sutil e aparece depois: o mesmo arquivo processado duas vezes porque não havia cache nem controle de repetição, dobrando o custo sem que ninguém perceba.
O que a gente constrói
Ingestão que aguenta arquivo real
Upload com limite explícito, validação do tipo pelo conteúdo e não pela extensão, e armazenamento com endereço temporário. Áudio longo e vídeo entram por fila, nunca pela requisição direta.
Transcrição e entendimento
Fala vira texto com marcação de tempo e separação de quem falou. Vídeo vira quadro, transcrição e descrição. Documento digitalizado vira página renderizada e indexada, para que a busca ache o que está dentro da imagem.
Geração, quando é o caso
Imagem, narração ou vídeo curto gerados a partir do seu material, orquestrados como trabalho assíncrono com estado visível: aguardando, processando, pronto ou falhou, com motivo.
Entrega e medição
O resultado vai para onde tem que ir, e cada item carrega o custo real do que consumiu. Você vê custo por cliente e por tipo de mídia, não só o total do mês.
O que vem de série
- Fila com worker separado, para que processamento pesado não derrube quem está navegando.
- Estado visível de cada trabalho, com motivo de falha legível em vez de erro cru.
- Cache do que já foi processado, porque reprocessar o mesmo arquivo é o desperdício mais comum.
- Teto diário e interruptor, já que geração de mídia é a categoria que estoura orçamento mais rápido.
- Limite de tamanho e duração alinhado com a memória real do servidor, para não haver queda no meio do processamento.
- Aviso de gravação e retenção declarada quando há voz de pessoa envolvida, como manda a LGPD.
Duas peças do portfólio cobrem as duas pontas. A plataforma de transcrição recebe arquivo, link de vídeo ou microfone ao vivo, devolve texto pesquisável e mede o custo reservando antes e ajustando pelo valor real depois, com teto e interruptor: ver funcionando. E o assistente de voz sobre documentos fecha o laço de áudio inteiro, ouvindo a pergunta e respondendo falado com a fonte citada: ver funcionando.
Limites
Não fazemos edição criativa de vídeo. A gente constrói o pipeline que processa e gera em escala, não a peça publicitária.
Geração de mídia com pessoa real exige autorização de uso de imagem e voz, e isso entra no contrato antes de entrar no código.