Cientistas do Alibaba Group apresentam o VACE, um modelo de IA multifuncional

Cientistas do Alibaba Group apresentaram o VACE, um modelo de inteligência artificial de uso geral, desenvolvido para executar uma ampla gama de tarefas de geração e edição de vídeo dentro de um único sistema.

A espinha dorsal do modelo é uma arquitetura de transformador de difusão aprimorada, mas o destaque aqui é o novo formato de entrada: a “Unidade de Condição de Vídeo” (VCU). A VCU é a resposta do Alibaba à desordem das entradas multimodais — ela processa desde prompts em texto até sequências de imagens ou vídeos de referência, além de máscaras espaciais, convertendo tudo em uma representação unificada. A equipe criou mecanismos dedicados para integrar essas entradas díspares de forma colaborativa, evitando conflitos.

VCU Framework Overview

O VACE utiliza uma técnica chamada “desacoplamento de conceitos” para dividir cada imagem em regiões editáveis e fixas, proporcionando ao modelo um controle minucioso sobre o que é alterado e o que permanece inalterado. | Imagem: Jiang et al.

O processo tem início com máscaras que dividem a imagem em áreas “reativas” — alvos para modificação — e zonas “inativas”, que são deixadas intactas. Todas as informações visuais são incorporadas em um espaço de características compartilhado e, em seguida, combinadas com a entrada de texto correspondente.

Para manter o vídeo gerado consistente de quadro para quadro, o VACE mapeia essas características em um espaço latente estruturado de acordo com o transformador de difusão. Camadas de incorporação temporal garantem que a compreensão da sequência pelo modelo permaneça coesa à medida que ele percorre os quadros. Um mecanismo de atenção, por sua vez, conecta informações provenientes de diferentes modalidades e intervalos temporais, permitindo que o sistema trate todo o conteúdo de forma integrada — seja na criação de novo material ou na edição do já existente.

De texto para vídeo, de referência para vídeo e edição de vídeo

O conjunto de ferramentas do VACE abrange quatro tarefas principais: gerar vídeos a partir de prompts de texto, sintetizar novas cenas com base em imagens ou clipes de referência, realizar edições de vídeo para vídeo e aplicar máscaras para edições direcionadas. Essa abordagem “um modelo para a maioria” amplia consideravelmente as possibilidades de aplicação.

Na prática, as demonstrações são diversas — o VACE pode animar uma pessoa saindo de cena, criar um personagem de anime surfando, trocar pinguins por gatinhos ou expandir um fundo para manter a coerência visual. Se desejar explorar ainda mais o potencial da ferramenta, veja outros exemplos no site oficial do projeto.

VACE Tasks

De referências e animações à reorganização de objetos e expansão de cenários, o VACE demonstra uma ampla gama de capacidades em síntese visual. | Imagem: Jiang et al.

O treinamento começou pelos fundamentos: inicialmente, a equipe concentrou-se em técnicas de inpainting e outpainting para fortalecer o pipeline de texto para vídeo, e depois incorporou imagens de referência, avançando para tarefas de edição mais complexas. Para a obtenção dos dados, foram utilizados vídeos disponíveis na internet, os quais foram automaticamente filtrados, segmentados e enriquecidos com anotações de profundidade e pose.

Avaliação do VACE em doze tarefas de edição de vídeo

Para medir o desempenho do VACE, os pesquisadores desenvolveram uma bateria de testes composta por 480 exemplos, abrangendo uma dúzia de tarefas de edição de vídeo — como inpainting, outpainting, estilização, controle de profundidade e geração guiada por referência. Segundo os resultados apresentados, o VACE supera os modelos open-source especializados em todas as métricas quantitativas e estudos com usuários. Apesar disso, ainda há uma lacuna na geração de vídeo a partir de referências, onde modelos comerciais como Vidu e Kling obtêm desempenho superior.

Os pesquisadores do Alibaba apontam o VACE como um passo importante rumo a modelos de vídeo universais e multimodais. O próximo desafio é ampliar o modelo com conjuntos de dados maiores e mais poder computacional, sendo que partes dele estão previstas para serem lançadas como open-source no GitHub.

O VACE se insere no panorama mais amplo das ambições de inteligência artificial do Alibaba, acompanhando uma série de lançamentos recentes de grandes modelos de linguagem — especialmente a série Qwen. Outros gigantes tecnológicos chineses, como a ByteDance, também estão investindo fortemente em IA para vídeo, chegando, por vezes, a igualar ou até superar ofertas ocidentais, como a Sora, da OpenAI, ou o Veo 2, do Google.