Protocolo de revisão humana gratuito
Scorecard de qualidade de troca de rosto para fotos, vídeos e GIFs
Classifique uma saída gerada com sete critérios visíveis, três portões críticos de publicação e uma fórmula ponderada transparente. Em seguida, mapeie a revisão para nove famílias de métricas e três protocolos de referência de vídeo publicados sem tratar pontuações incompatíveis como equivalentes.
Resposta direta
Uma pontuação de qualidade de troca de rosto precisa de critérios visíveis e um limite de evidência
Este scorecard estrutura uma revisão humana de uma saída específica. Não inspeciona um rosto biometricamente, prevê um resultado não visto ou transforma uma amostra favorável em uma afirmação sobre um modelo ou provedor inteiro.
Avaliação interativa
Pontue uma saída com o mesmo padrão
Escolha o tipo de mídia, complete os portões, classifique cada critério aplicável e mantenha uma nota de evidência curta para qualquer coisa que outro revisor deva ser capaz de encontrar.
Âncoras de classificação
Use o mesmo significado de 0 a 4 para cada critério
A escala descreve o defeito mais forte observado no material amostrado para aquele critério. Não é uma pontuação de confiança, probabilidade ou medição biométrica.
| Classificação | Âncora | Definição |
|---|---|---|
| 0 | Inutilizável | Uma falha ou defeito grave impede o uso pretendido. |
| 1 | Defeito grave | Um defeito claramente visível domina a visualização normal. |
| 2 | Defeito perceptível | Um defeito permanece fácil de notar e precisa de correção direcionada. |
| 3 | Defeito menor | Um pequeno defeito é visível na revisão, mas não domina a visualização normal. |
| 4 | Nenhum defeito material observado | Nenhum defeito material foi observado na saída amostrada para este critério. |
Dimensões da rubrica
Os pesos são explícitos e o movimento só é pontuado quando existe movimento
Vídeo e GIF usam todos os 100 pontos de peso base. Foto exclui estabilidade temporal e normaliza os 90 pontos restantes para um resultado de 100 pontos.
| Critério | Peso base | Mídia | Pergunta de revisão |
|---|---|---|---|
| Preservação de identidade | 24% | foto, vídeo, gif | Os olhos, sobrancelhas, nariz, boca, queixo, sinais de idade e identidade geral visíveis permanecem coerentes com a referência pretendida? |
| Limite e mesclagem do rosto | 16% | foto, vídeo, gif | A textura da pele, bordas do rosto, orelhas, queixo, linha do cabelo e pescoço fazem a transição para a cena alvo sem um limite de colagem? |
| Coerência de pose e expressão | 14% | foto, vídeo, gif | A geometria facial permanece coerente com o ângulo da cabeça alvo, olhar, estado dos olhos, formato da boca e expressão? |
| Continuidade de iluminação e cor | 14% | foto, vídeo, gif | Exposição, cor, sombreamento da pele, realces e sombras permanecem consistentes com a cena alvo? |
| Continuidade de oclusão e acessórios | 12% | foto, vídeo, gif | Cabelo, mãos, óculos, máscaras, microfones, objetos em primeiro plano e outras oclusões permanecem na ordem visual correta? |
| Integridade técnica | 10% | foto, vídeo, gif | A saída está livre de desfoque material, ringing, artefatos de bloco, rasgos, recursos duplicados, mudanças abruptas de textura ou quadros danificados? |
| Estabilidade temporal | 10% | vídeo, gif | Através do movimento, a identidade permanece estável sem cintilação, deriva, perda de rosto, mudanças repentinas de geometria ou uma costura de loop visível? |
Baixe o protocolo reutilizável
O JSON contém a escala completa, portões, critérios, fórmula, faixas de decisão, limites de evidência, licença e referências. O CSV é um modelo de revisão tabular de sete linhas em branco, e o arquivo BibTeX fornece uma citação estável.
Mapa de referência automatizado
Métricas de qualidade de troca de rosto respondem a perguntas diferentes
Um referencial defensável mantém separados a transferência de identidade de origem, a preservação de atributo alvo, o realismo de distribuição de imagem e vídeo, o comportamento quadro a quadro, a avaliação apenas de saída e a revisão humana. O mapa de decisão versionado nomeia o que cada família compara e o protocolo necessário antes que um valor possa ser interpretado.
| Medida | Compara | Usar | Limite |
|---|---|---|---|
| Recuperação de identidade ou similaridade de incorporação | Identidade de origem versus a saída trocada, usando um codificador facial nomeado ou galeria de origem. | Quão fortemente a saída retém evidência de identidade de origem sob o avaliador fixo? Similaridade ou desempenho de recuperação mais altos geralmente são melhores dentro do mesmo protocolo. | O codificador, corte, galeria, demografia, limite e pré-processamento afetam o valor. Não é um veredito biométrico para uma pessoa. |
| Estabilidade de similaridade de identidade quadro a quadro | A sequência de similaridades identidade-fonte para saída entre quadros de saída detectados sob um codificador facial nomeado. | A evidência de identidade-fonte permanece estável à medida que pose, expressão, oclusão e condições de cena mudam ao longo do tempo? Menor dispersão pode indicar maior estabilidade apenas quando a similaridade média de identidade ou o resultado de recuperação são reportados ao lado dela. | Uma identidade consistentemente errada pode ter baixa variância. A dispersão não pode substituir a similaridade média ou a recuperação, e os valores não são portáveis entre codificadores ou pipelines de quadros. |
| Erro de pose e expressão | Estimativas de pose ou expressão alvo versus a saída trocada sob um estimador nomeado. | Quão fielmente a saída preserva a pose e expressão da cabeça alvo sob o estimador fixo? Erro menor geralmente é melhor dentro do mesmo estimador e parametrização. | Os valores não são portáveis entre diferentes estimadores, recortes, espaços de parâmetros, convenções de landmarks ou pipelines de pré-processamento. |
| Frechet Inception Distance (FID) | Uma distribuição de imagens ou quadros gerados versus uma distribuição de referência documentada. | Quão próximas estão duas distribuições de características sob o extrator de características fixo e protocolo de amostragem? Menor é melhor apenas dentro do mesmo conjunto de dados, extrator, pré-processamento e protocolo de amostra. | Uma única saída de troca facial não pode ter um FID defensável porque uma única imagem não é uma distribuição. FID não isola a correção da identidade. |
| Frechet Video Distance (FVD) | Uma distribuição de clipes de vídeo gerados versus uma distribuição de clipes de referência documentada sob um extrator de características de vídeo nomeado. | Quão próximas estão as distribuições de características de vídeo geradas e de referência sob um protocolo fixo de amostragem de clipes? Menor é melhor apenas dentro do mesmo conjunto de dados, extrator de características, duração do clipe, taxa de quadros, pré-processamento e protocolo de amostra. | Um clipe de saída não é um resultado FVD defensável em nível de distribuição. FVD não isola identidade fonte, preservação de atributo alvo, sincronização labial ou um defeito temporal específico. |
| Consistência do sujeito e do fundo | Consistência de características entre quadros de saída e contra quadros anteriores, alvo ou de referência. | Quão estáveis são as características do sujeito e do fundo através do movimento sob o protocolo de vídeo fixo? Maior consistência geralmente é melhor sob a mesma implementação. | Consistência sozinha não pode estabelecer mapeamento de identidade correto, realismo visual, precisão de movimento ou prontidão para publicação. |
| Diagnósticos de olhar, abertura ocular, sincronização labial e movimento | Comportamento nomeado de olho, áudio-lábio, landmark ou fluxo óptico entre sequências alvo e de saída. | Quais atributos alvo dinâmicos específicos permanecem sincronizados através do vídeo gerado? Direção e unidade dependem do diagnóstico nomeado; reporte cada um separadamente. | Esses diagnósticos não são intercambiáveis, precisam de um protocolo de vídeo documentado e não se aplicam a todos os tipos de mídia. |
| Avaliação de qualidade sem referência aprendida | A saída sozinha, avaliada por um modelo treinado contra julgamentos humanos ranqueados ou dados de qualidade rotulados. | Como um avaliador treinado classifica a qualidade visível da saída quando mídia de referência explícita não está disponível? Direção depende da saída do modelo; valide-a em uma distribuição de validação documentada. | O desempenho depende dos dados de treinamento e do escopo de validação. Uma pontuação apenas de saída não pode estabelecer transferência correta de identidade fonte por si só. |
| Scorecard humano estruturado | Uma saída visível contra âncoras de defeito explícitas, portões de publicação e notas de revisor. | Quais defeitos visíveis ou portões de uso não resolvidos um revisor observa nesta saída específica? Use classificações ordinais ancoradas; não reinterprete o resultado como uma probabilidade ou pontuação biométrica. | Evidência subjetiva sobre a amostra revisada, não precisão do modelo, classificação do provedor, probabilidade ou similaridade biométrica. |
Protocolos de benchmark publicados não são intercambiáveis.
A tabela de correspondência abaixo registra apenas as configurações descritas pelos artigos primários. Ela não copia suas tabelas de resultados, afirma que todo conjunto de dados é baixável ou transforma valores de diferentes avaliadores em um único leaderboard.
| Protocolo e fonte | Unidade de comparação | Medidas reportadas | Limite de comparabilidade |
|---|---|---|---|
| CASIA FaceSwapping | Pares de vídeo fonte-alvo montados sob três protocolos de isolamento de fatores. Normal: 4.500 pares não sobrepostos de mesma etnia de gravações normais. Interétnico: 1.200 pares abrangendo ambas as direções entre grupos asiáticos, africanos e caucasianos. Atributo cruzado: 4.300 pares abrangendo variações normais e de pose, expressão ou iluminação em ambas as direções. | recuperação de identidade, similaridade de identidade, erro de pose, erro de expressão, FID, consistência do sujeito, consistência do fundo. Nenhum protocolo de revisão humana está resumido nesta tabela de correspondência. | As três fatias isolam diferentes fatores dentro da configuração CASIA. Seus valores dependem da construção de pares, modelos, extratores de características, resoluções e agregação daquele artigo. |
| IDBench-V | 200 pares de vídeo-fonte e imagem-alvo do mundo real reportados no artigo. Um conjunto de avaliação de 200 pares cobrindo rostos pequenos, poses extremas de cabeça, oclusões severas, expressões complexas ou dinâmicas e cenas de múltiplas pessoas desordenadas. | Similaridade de identidade ArcFace, similaridade de identidade InsightFace, similaridade de identidade CurricularFace, variância de similaridade de identidade por quadro, erro de pose, erro de expressão, consistência de fundo, consistência do sujeito, suavidade de movimento, FVD. O artigo reporta 19 avaliadores usando classificações de 1 a 5 para similaridade de identidade, preservação de atributo e qualidade de vídeo. | A linha registra apenas o protocolo reportado no artigo. Ela não afirma disponibilidade de download público, reproduz um resultado ou torna seus valores portáveis para outro benchmark. |
| CanonSwap VFS benchmark | 100 pares fonte-alvo amostrados do VFHQ; cada alvo usa os primeiros 100 quadros e quatro segundos de áudio correspondente. Um conjunto de avaliação de troca facial em vídeo de 100 pares com janelas fixas de quadro e áudio. | similaridade de identidade, recuperação de identidade, erro de pose, erro de expressão, erro de olhar, erro de proporção de abertura ocular, LSE-D, LSE-C, consistência temporal de fluxo óptico, FVD. Nenhum protocolo de revisão humana está resumido nesta tabela de correspondência. | O protocolo usa escolhas específicas do artigo de quadro, áudio, estimador e extrator de características. Seus valores não devem ser comparados diretamente com valores do IDBench-V ou CASIA. |
Baixe o mapa de decisão de métricas
O JSON preserva todas as 9 famílias de métricas, a tabela de correspondência de 3 protocolos, pré-requisitos, direções de interpretação, limites de evidência e fontes primárias. O CSV contém a tabela de famílias de métricas; o registro BibTeX fornece atribuição estável.
Protocolo de avaliação de cinco etapas
Torne cada revisão reproduzível o suficiente para outra pessoa inspecionar.
- Escolha o tipo de saída e identifique a amostra. Selecione foto, vídeo ou GIF e registre um identificador de amostra, revisor e data de revisão.
- Confirme os três portões críticos de publicação. Confirme a permissão, verifique o mapeamento de identidade pretendido e revise se uma divulgação de conteúdo de IA é necessária.
- Revise cada critério aplicável. Classifique identidade, limite do rosto, pose e expressão, iluminação, oclusão, integridade técnica e estabilidade temporal, quando aplicável.
- Leia o resultado ponderado sem substituir os portões. Use o resultado para priorizar correções. Uma pontuação numérica nunca substitui portões de permissão, mapeamento ou divulgação não resolvidos.
- Exporte o registro completo de evidência. Baixe JSON ou CSV, mantenha as notas e repita o mesmo protocolo para cada saída que pretende comparar.
Limite de evidência e fontes
Revisão subjetiva é útil apenas quando seus limites estão visíveis.
Limite
A pontuação é uma observação humana estruturada de uma saída revisada, não uma medição biométrica de identidade.
Limite
A rubrica não estabelece precisão do modelo, qualidade média, segurança, velocidade, confiabilidade ou superioridade do provedor.
Limite
Uma pontuação alta não substitui consentimento, divulgação, revisão legal, de acessibilidade ou específica do público.
Limite
Uma afirmação entre provedores requer as mesmas entradas, execuções repetidas, revisores independentes, condições de visualização documentadas e relatórios estatísticos.
- ITU-R BT.500-15: Methodologies for the subjective assessment of the quality of television images - Princípios gerais para avaliação subjetiva documentada de imagem; a rubrica DeepSwapAI não é um teste de laboratório ITU.
- ITU-T P.910 (10/2023): Subjective video quality assessment methods for multimedia applications - Princípios gerais para avaliação subjetiva documentada de multimídia; a rubrica DeepSwapAI é um fluxo de trabalho prático de revisão única.
- Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark - Define o benchmark CASIA FaceSwapping e documenta protocolos de identidade, atributo alvo, distribuição e consistência de vídeo.
- DreamID-V: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer - Introduz o protocolo IDBench-V de 200 pares e reporta similaridade de identidade multi-codificador, variância por quadro, atributo alvo, consistência de vídeo, FVD e medidas de revisão humana.
- CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation - Reporta medidas específicas de vídeo de identidade, atributo alvo, sincronização, consistência temporal e distribuição.
- Rank-based No-reference Quality Assessment for Face Swapping - Estuda avaliação de qualidade de troca facial aprendida apenas com saída treinada contra julgamentos humanos ranqueados.
- GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium - Introduz a Distância de Frechet Inception como uma medida de avaliação em nível de distribuição.
- Pesquisa de prontidão de entrada controlada DeepSwapAI - evidência separada apenas de entrada sem pontuação de saída gerada.
- Conjunto de dados de scorecard canônico - current JSON publicado pelo site canônico.
- Manifesto de pesquisa verificado por checksum - tamanhos em bytes e checksums SHA-256 para 17 arquivos canônicos.
- Instantâneo do repositório do Patrimônio Histórico de Software - o estado v1.6.2 preservado independentemente como swh:
1: .snp: f11738615eea 9f999c8709a0 da73130f0426 6209 - Metodologia de verificação de afirmação DeepSwapAI - como fatos do produto, comparações e limites de evidência são revisados.
Perguntas do scorecard
O que o número pode e não pode estabelecer
Isso envia minha mídia ou notas?
Não. A página não tem entrada de mídia, e os controles do scorecard não enviam classificações ou notas para DeepSwapAI.
Isso é uma pontuação de identidade biométrica?
Não. É uma observação humana documentada de características visíveis de saída, não precisão de reconhecimento facial ou similaridade de embedding.
Uma única pontuação pode classificar provedores de troca facial?
Não. Uma comparação defensável precisa de entradas compartilhadas, saídas repetidas, múltiplos revisores, condições de visualização controladas e relatórios estatísticos.
Por que a estabilidade temporal é excluída de fotos?
Uma imagem estática não tem sequência de quadros. O modo foto normaliza os seis critérios aplicáveis de 90 pontos de peso base para 100.
Posso reutilizar a rubrica?
Sim. O JSON publicado e o CSV em branco usam CC BY 4.0 e incluem a declaração de atribuição necessária e um registro BibTeX baixável.
O FID pode medir uma única saída de troca facial?
Não. FID compara distribuições de conjuntos de imagens geradas e de referência. Uma imagem não é uma distribuição.
A identidade deve ser comparada com a fonte ou o alvo?
Recuperação e similaridade de identidade normalmente comparam a saída com a fonte. Preservação de pose e expressão normalmente comparam a saída com o alvo.
Os valores do CASIA FaceSwapping, IDBench-V e CanonSwap podem ser comparados diretamente?
Não. Sua construção de pares, fatias de desafio, avaliadores, extratores de características, janelas de quadro ou áudio, pré-processamento e agregação diferem. Reproduza um protocolo compartilhado antes de comparar valores.
Gere a menor saída representativa primeiro
Escolha uma referência de identidade e alvo permitida, gere um resultado representativo, então retorne para pontuá-lo antes de escalar um lote ou clipe longo.