Referência técnica com fontes citadas
Glossário de troca de rosto com IA
Definições em inglês simples para 24 termos usados em pesquisa e avaliação de troca de rostos, cada um emparelhado com uma fonte primária e um limite que evita alegações excessivas.
Resposta direta
A terminologia de troca de rostos precisa de uma definição e de um limite
Um rosto fonte fornece pistas de identidade. A mídia alvo fornece a cena e os atributos não relacionados à identidade pretendidos. Detecção, alinhamento, mascaramento e geração descrevem partes de um fluxo de trabalho; similaridade de identidade, métricas perceptuais e revisão humana respondem a diferentes perguntas de avaliação.
Índice de termos
Pule para o conceito que você precisa
Fundamentos do fluxo de trabalho
Fundamentos do fluxo de trabalho
Os papéis da mídia e os termos de pré-processamento geométrico que definem o que entra em um fluxo de trabalho de troca de rostos.
Troca de rosto
#Também chamado de: troca de rostos por IA, face swapping
Uma tarefa de visão computacional que transfere sinais de identidade de um rosto de origem para uma imagem ou vídeo alvo, tentando preservar atributos do alvo como pose, expressão, cabelo e fundo.
Limite da evidência: Esta é uma definição de tarefa, não uma garantia de que todo sistema preserva todos os atributos ou de que um uso específico tem permissão.
Fontes primárias: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; Fine-Grained Face Swapping via Regional GAN Inversion
Rosto de origem
#Também chamado de: identidade fonte, referência de identidade
A pessoa ou imagem de referência que fornece os sinais de identidade destinados ao rosto gerado.
Limite da evidência: A fonte normalmente não define a cena alvo, corpo, cabelo, pose ou fundo, e a divisão exata depende do método.
Fontes primárias: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; Reinforced Disentanglement for Face Swapping without Skip Connection
Mídia alvo
#Também chamado de: imagem alvo, vídeo alvo
A imagem ou vídeo que fornece a cena e os atributos não relacionados à identidade que um método de troca de rosto tenta reter.
Limite da evidência: Os métodos diferem em quais atributos alvo eles retêm, portanto, a preservação do alvo deve ser avaliada em vez de assumida.
Fontes primárias: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Detecção de rosto
#Também chamado de: localização facial, face localization
O processo de localizar uma ou mais regiões faciais em uma imagem ou quadro de vídeo antes do alinhamento, extração de características ou geração.
Limite da evidência: Uma região facial detectada não é uma decisão de identidade, uma verificação de consentimento ou prova de que o processamento posterior será bem-sucedido.
Fontes primárias: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild
Marcos faciais
#Também chamado de: marcos faciais, pontos de referência facial
Pontos-chave faciais estimados, como cantos dos olhos, nariz e localizações da boca, usados para descrever a geometria facial para alinhamento ou condicionamento.
Limite da evidência: Os layouts de marcos, contagens de pontos e unidades de erro variam por detector e protocolo; eles não são diretamente intercambiáveis.
Fontes primárias: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild; DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion
Alinhamento facial
#Também chamado de: alinhamento facial, corte facial alinhado
Uma etapa de normalização geométrica que usa a estrutura facial detectada para colocar um rosto em um corte, escala e orientação consistentes para processamento posterior.
Limite da evidência: As convenções e transformações de alinhamento variam, e um corte alinhado não estabelece identidade, qualidade ou permissão.
Fontes primárias: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild; ArcFace: Additive Angular Margin Loss for Deep Face Recognition
Identidade e preservação
Identidade e preservação
Os conceitos usados para separar as pistas de identidade da fonte dos atributos alvo que um resultado tenta reter.
Incorporação facial
#Também chamado de: embedding de identidade, vetor de características faciais
Uma representação numérica aprendida projetada para que imagens faciais possam ser comparadas em um espaço de características sob um modelo de reconhecimento específico e protocolo de pré-processamento.
Limite da evidência: As dimensões do vetor, funções de distância e limites de decisão dependem do modelo e da configuração de avaliação; um embedding não é inerentemente um veredito de identidade ou matematicamente garantido como não reconstruível.
Fontes primárias: ArcFace: Additive Angular Margin Loss for Deep Face Recognition
Similaridade de identidade
#Também chamado de: retenção de identidade, pontuação de preservação de identidade
Uma comparação dependente de protocolo entre representações de identidade de origem e saída, comumente calculada a partir de um codificador de rosto nomeado e função de similaridade.
Limite da evidência: As pontuações não são portáveis entre codificadores, cortes, conjuntos de dados, limites ou dados demográficos e não devem ser apresentadas como um veredito biométrico para uma única saída.
Fontes primárias: ArcFace: Additive Angular Margin Loss for Deep Face Recognition; PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion
Preservação de atributos alvo
#Também chamado de: preservação de atributos, consistência alvo
A extensão em que um resultado retém características alvo pretendidas, como pose, expressão, cabelo, iluminação, roupas e fundo, enquanto altera os sinais de identidade facial.
Limite da evidência: Os atributos e estimadores avaliados devem ser nomeados; uma pontuação agregada pode ocultar falhas em um atributo individual.
Fontes primárias: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Máscara facial
#Também chamado de: máscara de troca, máscara facial
Um mapa espacial que identifica qual região da imagem pode ser gerada, mesclada ou avaliada como parte de uma operação de troca de rosto.
Limite da evidência: A construção e a semântica da máscara variam por método; uma máscara não resolve por si só oclusão, borda ou inconsistência de cor.
Fontes primárias: DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion; Fine-Grained Face Swapping via Regional GAN Inversion
Segmentação facial
#Também chamado de: segmentação semântica facial
Segmentação semântica em nível de pixel de componentes faciais e regiões circundantes, como pele, olhos, boca, cabelo ou fundo.
Limite da evidência: Os conjuntos de rótulos e a qualidade da segmentação dependem do parser e do conjunto de dados, e regiões incorretas podem se propagar para síntese ou composição posteriores.
Fontes primárias: Fine-Grained Face Swapping via Regional GAN Inversion
Mesclagem de limite facial
#Também chamado de: mistura de borda, composição facial
A etapa de composição que faz a transição de uma região facial sintetizada para o alvo em torno do tom de pele, bordas, iluminação e conteúdo próximo.
Limite da evidência: Uma borda visualmente suave não estabelece identidade correta, características internas naturais ou comportamento consistente entre quadros de vídeo.
Fontes primárias: Fine-Grained Face Swapping via Regional GAN Inversion; Reinforced Disentanglement for Face Swapping without Skip Connection
Oclusão
#Também chamado de: obstrução facial, rosto ocluído
Uma condição em que parte de um rosto está oculta por cabelo, mãos, óculos, objetos, outra pessoa ou o limite da imagem.
Limite da evidência: O tratamento de oclusão depende do método e da cena; um benchmark deve especificar a região afetada e as condições de visualização.
Fontes primárias: Fine-Grained Face Swapping via Regional GAN Inversion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Pose da cabeça
#Também chamado de: pose facial, orientação da cabeça
A orientação estimada de uma cabeça em relação à câmera, frequentemente representada por rotação, inclinação e inclinação lateral ou por marcos e parâmetros 3D.
Limite da evidência: Os valores de pose dependem do estimador e da convenção de coordenadas; combinar apenas a pose não pode prever o realismo da saída.
Fontes primárias: DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion; PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion
Expressão facial
#Também chamado de: preservação de expressão
A configuração visível de características faciais associadas a movimentos como sorrir, piscar ou abrir a boca, frequentemente tratada como um atributo alvo na troca de rostos.
Limite da evidência: Os rótulos e parâmetros de expressão dependem do estimador e podem perder expressões sutis, assimétricas ou culturalmente interpretadas.
Fontes primárias: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Consistência de vídeo
Consistência de vídeo
Conceitos de movimento e sequência de quadros que não existem em uma única imagem estática.
Consistência temporal
#Também chamado de: coerência temporal, consistência quadro a quadro
A estabilidade dos sinais de identidade, atributos alvo e detalhes visuais em quadros de vídeo consecutivos, em vez de em um quadro isolado.
Limite da evidência: Uma medida de alta consistência pode preservar consistentemente o resultado errado, portanto, a correção da identidade e a qualidade visível devem ser avaliadas separadamente.
Fontes primárias: DynamicFace: High-Quality and Consistent Face Swapping for Image and Video; CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation
Fluxo óptico
#Também chamado de: campo de movimento, correspondência de pixels
Um campo de movimento denso estimado que mapeia localizações de imagem entre quadros e pode suportar análise de movimento, deformação ou diagnósticos temporais.
Limite da evidência: O fluxo óptico é uma estimativa que pode falhar em torno de oclusão, desfoque, mudanças de iluminação e regiões recém-visíveis; não é uma pontuação de qualidade por si só.
Fontes primárias: RAFT: Recurrent All-Pairs Field Transforms for Optical Flow; CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation
Avaliação
Avaliação
Métricas e protocolos de revisão que respondem a diferentes perguntas de qualidade sob condições explícitas.
Structural Similarity Index (SSIM)
#Também chamado de: SSIM
Uma medida de similaridade de imagem de referência completa que compara luminância, contraste e estrutura entre uma imagem de teste e uma imagem de referência.
Limite da evidência: O SSIM requer uma referência alinhada significativa, não é específico para rostos, e seu valor depende de escala, janelamento, tratamento de cor e pré-processamento.
Fontes primárias: Image Quality Assessment: From Error Visibility to Structural Similarity
Learned Perceptual Image Patch Similarity (LPIPS)
#Também chamado de: LPIPS, similaridade perceptual aprendida
Uma distância perceptual baseada em características de redes profundas que foi avaliada em relação a julgamentos humanos de similaridade de patches de imagem.
Limite da evidência: LPIPS não é uma pontuação de identidade; os valores dependem da rede selecionada, calibração, preparação da imagem e protocolo de comparação.
Fontes primárias: The Unreasonable Effectiveness of Deep Features as a Perceptual Metric
Frechet Inception Distance (FID)
#Também chamado de: FID
Uma distância em nível de conjunto entre distribuições de características de coleções de imagens geradas e de referência, originalmente calculada com características da Inception.
Limite da evidência: FID não é uma pontuação defensável para uma única imagem, e os resultados dependem da contagem de amostras, extrator de características, pré-processamento, conjunto de referência e implementação.
Fontes primárias: GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium; Rethinking FID: Towards a Better Evaluation Metric for Image Generation
Avaliação de qualidade sem referência
#Também chamado de: NR-IQA, avaliação cega de qualidade de imagem
Um método que estima a qualidade visual a partir de uma saída sem exigir uma imagem de referência original emparelhada.
Limite da evidência: Sua validade depende dos dados de treinamento e do design de validação; uma pontuação pode falhar em métodos, conteúdo ou distorções não vistos.
Fontes primárias: Rank-based No-reference Quality Assessment for Face Swapping
Scorecard de revisão humana
#Também chamado de: rubrica de avaliação humana, rubrica de revisão de saída
Uma rubrica repetível que pede a um revisor que registre critérios visíveis, âncoras de classificação, portas críticas e notas para uma saída específica.
Limite da evidência: Ele registra observações humanas estruturadas, não precisão do modelo, identidade biométrica, uma probabilidade ou uma classificação em todo o provedor.
Fontes primárias: DeepSwapAI scorecard de qualidade de saída de troca de rostos; Rank-based No-reference Quality Assessment for Face Swapping
Proveniência
Proveniência
Padrões para registrar de onde o conteúdo digital veio e o que aconteceu com ele.
C2PA
#Também chamado de: Coalizão para Proveniência e Autenticidade de Conteúdo
Um padrão técnico aberto para registrar informações de proveniência à prova de adulteração sobre conteúdo digital por meio de manifestos, asserções, ingredientes e reivindicações assinados.
Limite da evidência: O C2PA pode fornecer evidências de proveniência e sinais de adulteração, mas a especificação não determina se o conteúdo retratado é verdadeiro, preciso ou eticamente permitido.
Fontes primárias: C2PA Technical Specification 2.4; Explicador C2PA 2.3
Credenciais de Conteúdo
#Também chamado de: Credenciais de Conteúdo C2PA, credenciais de proveniência de conteúdo
A apresentação voltada ao usuário de informações de proveniência associadas a um ativo digital através do ecossistema C2PA.
Limite da evidência: A disponibilidade e os detalhes exibidos dependem da credencial, signatário, validador, ativo e plataforma; uma credencial não é uma declaração de que o conteúdo é factualmente verdadeiro.
Fontes primárias: Explicador C2PA 2.3; C2PA Technical Specification 2.4
Interpretação de métrica
Quatro regras evitam comparações enganosas
Nomeie a relação
Métricas de identidade normalmente comparam a saída com a identidade de origem. Métricas de preservação de pose e expressão normalmente comparam a saída com o destino. São perguntas diferentes.
Mantenha o protocolo constante
Dataset, recorte, avaliador, pré-processamento, implementação, contagem de amostras e agregação podem alterar um valor reportado. Um nome de métrica compartilhado não é suficiente.
Mantenha evidências de nível de conjunto e de saída única separadas
FID descreve distribuições de conjuntos de imagens. SSIM e LPIPS exigem uma referência de comparação significativa. Um scorecard humano registra observações visíveis sobre uma saída revisada.
Não colapse toda dimensão de qualidade
Identidade, preservação de atributo-alvo, limites, oclusão, integridade técnica e estabilidade temporal podem falhar de forma independente e devem permanecer inspecionáveis.
Perguntas do glossário
Como usar essas definições
Esta página revela a pilha exata do modelo DeepSwapAI?
Não. Ela define conceitos da indústria e pesquisa sem afirmar que todo método citado faz parte da implementação de produção.
Posso comparar a mesma métrica em dois artigos?
Somente após verificar se os datasets, avaliadores, pré-processamento, implementações e regras de agregação coincidem.
O FID pode medir uma única saída?
Não. FID é uma medida de nível de distribuição e precisa de conjuntos de imagens geradas e de referência.
As Credenciais de Conteúdo provam que uma imagem é verdadeira?
Não. Elas fornecem informações de proveniência e sinais de validação, não um julgamento factual de verdade.
Aplique os termos a uma saída visível
Use o scorecard gratuito para revisar identidade, limites, pose, iluminação, oclusão, integridade técnica e estabilidade de vídeo sem transformar uma amostra em uma afirmação geral do provedor.