Scheda qualità

Scheda qualità

Scheda qualità. Face swap IA nel browser per foto, batch, mappature di gruppo, video e GIF autorizzati. Conteúdo localizado: it. Confronto verificato dalle fonti.

Dal team prodotto DeepSwapAIProtocollo pubblicato il 18 luglio; crosswalk del benchmark revisionato il 28 luglio 2026Protocollo di revisione umana

Scheda qualità

Questa pagina spiega Scheda qualità in italiano: scopo, limiti e verifica. Il corpo revisionato conserva fatti, numeri, link e fonti; usa solo media autorizzati.

Confronto verificato dalle fonti: Face swap IA nel browser per foto, batch, mappature di gruppo, video e GIF autorizzati.

Un punteggio di qualità del face swap necessita di criteri visibili e un confine di evidenza

Questa scheda di valutazione struttura una revisione umana di un output specifico. Non ispeziona biometricamente un volto, non predice un risultato non visto, né trasforma un singolo campione favorevole in un'affermazione su un intero modello o fornitore.

7 criteri visibiliIdentità, fusione, posa, illuminazione, occlusione, integrità tecnica e stabilità del movimento.
3 cancelli criticiAutorizzazione, mappatura dell'identità prevista e dichiarazione di pubblicazione rimangono separati dal numero.
0 dati di revisione caricatiLa pagina non accetta file multimediali. Valutazioni, note, calcoli ed esportazioni rimangono in questa scheda del browser.

Valuta un output con lo stesso standard

Scegli il tipo di supporto, completa i cancelli, valuta ogni criterio applicabile e conserva una breve nota di evidenza per qualsiasi cosa un altro revisore dovrebbe essere in grado di trovare.

Viene eseguito localmente
Tipo di output
Cancelli critici di pubblicazione

Un punteggio non può sovrascrivere un cancello non risolto.

Valuta l'output visivo

Usa 0 per un fallimento inutilizzabile e 4 solo quando non si osserva alcun difetto materiale nel campione revisionato.

Preservazione dell'identitàOcchi visibili, sopracciglia, naso, bocca, mascella, indizi di età e identità complessiva rimangono coerenti con il riferimento previsto?24% peso base · Rivedi a dimensione di visualizzazione normale, poi ispeziona il volto durante la posa o l'inquadratura visibile più difficile.
Confine del volto e fusioneLa texture della pelle, i bordi del viso, le orecchie, la mascella, l'attaccatura dei capelli e il collo si fondono nella scena target senza un confine incollato?16% peso base · Ispeziona i bordi ad alto contrasto e l'intero perimetro del viso, non solo il centro del viso.
Coerenza di posa ed espressioneLa geometria facciale rimane coerente con l'angolazione della testa target, lo sguardo, lo stato degli occhi, la forma della bocca e l'espressione?14% peso base · Dai priorità a profili girati, occhi chiusi, bocche aperte, sorrisi e inclinazioni pronunciate della testa.
Continuità di illuminazione e coloreEsposizione, colore, ombreggiatura della pelle, luci e ombre rimangono coerenti con la scena target?14% peso base · Controlla la luce direzionale, la luce colorata, i confini delle ombre e le transizioni tra regioni chiare e scure.
Continuità di occlusione e accessoriCapelli, mani, occhiali, maschere, microfoni, oggetti in primo piano e altre occlusioni rimangono nel corretto ordine visivo?12% peso base · Esamina ogni punto in cui un oggetto incrocia il viso o in cui il viso si sposta dietro un altro oggetto.
Integrità tecnicaL'output è privo di sfocatura materiale, ringing, artefatti a blocchi, strappi, caratteristiche duplicate, cambiamenti bruschi di texture o fotogrammi danneggiati?10% peso base · Ispeziona alla dimensione di consegna prevista ed evita di trattare la sfocatura da movimento deliberata o la profondità di campo come un difetto di per sé.
Stabilità temporaleNel movimento, l'identità rimane stabile senza sfarfallio, deriva, perdita del volto, cambiamenti improvvisi di geometria o una cucitura di loop visibile?10% peso base · Rivedi l'intero clip a velocità normale, poi riproduci la svolta più difficile, l'occlusione, il taglio e il confine del loop fotogramma per fotogramma.

Usa lo stesso significato da 0 a 4 per ogni criterio

La scala descrive il difetto più forte osservato nel materiale campionato per quel criterio. Non è un punteggio di confidenza, probabilità o misura biometrica.

ValutazioneAncoraDefinizione
0InutilizzabileUn fallimento o un difetto grave impedisce l'uso previsto.
1Difetto maggioreUn difetto chiaramente visibile domina la visione normale.
2Difetto evidenteUn difetto rimane facile da notare e necessita di una correzione mirata.
3Difetto minoreUn piccolo difetto è visibile in revisione ma non domina la visione normale.
4Nessun difetto materiale osservatoNessun difetto materiale è stato osservato nell'output campionato per questo criterio.

I pesi sono espliciti e il movimento viene valutato solo quando esiste

Video e GIF utilizzano tutti i 100 punti di peso base. La foto esclude la stabilità temporale e normalizza i restanti 90 punti a un risultato di 100 punti.

CriterioPeso baseSupportoDomanda di revisione
Preservazione dell'identità24%foto, video, gifOcchi visibili, sopracciglia, naso, bocca, mascella, indizi di età e identità complessiva rimangono coerenti con il riferimento previsto?
Confine del volto e fusione16%foto, video, gifLa texture della pelle, i bordi del viso, le orecchie, la mascella, l'attaccatura dei capelli e il collo si fondono nella scena target senza un confine incollato?
Coerenza di posa ed espressione14%foto, video, gifLa geometria facciale rimane coerente con l'angolazione della testa target, lo sguardo, lo stato degli occhi, la forma della bocca e l'espressione?
Continuità di illuminazione e colore14%foto, video, gifEsposizione, colore, ombreggiatura della pelle, luci e ombre rimangono coerenti con la scena target?
Continuità di occlusione e accessori12%foto, video, gifCapelli, mani, occhiali, maschere, microfoni, oggetti in primo piano e altre occlusioni rimangono nel corretto ordine visivo?
Integrità tecnica10%foto, video, gifL'output è privo di sfocatura materiale, ringing, artefatti a blocchi, strappi, caratteristiche duplicate, cambiamenti bruschi di texture o fotogrammi danneggiati?
Stabilità temporale10%video, gifNel movimento, l'identità rimane stabile senza sfarfallio, deriva, perdita del volto, cambiamenti improvvisi di geometria o una cucitura di loop visibile?

Scarica il protocollo riutilizzabile

Il JSON contiene la scala completa, i cancelli, i criteri, la formula, le bande decisionali, i limiti di evidenza, la licenza e i riferimenti. Il CSV è un modello di revisione vuoto a sette righe e il file BibTeX fornisce una citazione stabile.

Le metriche di qualità del face swap rispondono a domande diverse

Un benchmark difendibile mantiene separati il trasferimento dell'identità sorgente, la conservazione degli attributi target, il realismo della distribuzione di immagini e video, il comportamento fotogramma per fotogramma, la valutazione del solo output e la revisione umana. La mappa decisionale con versione nomina cosa confronta ogni famiglia e il protocollo necessario prima che un valore possa essere interpretato.

MisuraConfrontaUsoConfine
Somiglianza di recupero dell'identità o embeddingIdentità sorgente rispetto all'output scambiato, utilizzando un encoder facciale nominato o una galleria sorgente.Quanto fortemente l'output conserva l'evidenza dell'identità sorgente sotto il valutatore fisso? Una maggiore somiglianza o prestazioni di recupero sono solitamente migliori all'interno dello stesso protocollo.L'encoder, il ritaglio, la galleria, i dati demografici, la soglia e la pre-elaborazione influenzano il valore. Non è un verdetto biometrico per una singola persona.
Stabilità della somiglianza dell'identità fotogramma per fotogrammaLa sequenza delle somiglianze di identità da sorgente a output attraverso i fotogrammi di output rilevati sotto un encoder facciale nominato.L'evidenza dell'identità sorgente rimane stabile al variare di posa, espressione, occlusione e condizioni della scena nel tempo? Una minore dispersione può indicare una maggiore stabilità solo quando la somiglianza media dell'identità o il risultato di recupero sono riportati accanto.Un'identità costantemente errata può avere una varianza bassa. La dispersione non può sostituire la somiglianza media o il recupero, e i valori non sono portabili tra encoder o pipeline di fotogrammi.
Errore di posa ed espressioneStime di posa o espressione target rispetto all'output scambiato sotto uno stimatore nominato.Quanto fedelmente l'output preserva la posa della testa target e l'espressione sotto lo stimatore fisso? Un errore minore è solitamente migliore all'interno dello stesso stimatore e parametrizzazione.I valori non sono portabili tra diversi stimatori, ritagli, spazi dei parametri, convenzioni dei landmark o pipeline di pre-elaborazione.
Frechet Inception Distance (FID)Una distribuzione di immagini o fotogrammi generati rispetto a una distribuzione di riferimento documentata.Quanto sono vicine due distribuzioni di caratteristiche sotto l'estrattore di caratteristiche fisso e il protocollo di campionamento? Un valore più basso è migliore solo all'interno dello stesso dataset, estrattore, pre-elaborazione e protocollo di campionamento.Un singolo output di face swap non può avere un FID difendibile perché una singola immagine non è una distribuzione. FID non isola la correttezza dell'identità.
Frechet Video Distance (FVD)Una distribuzione di clip video generati rispetto a una distribuzione di clip di riferimento documentata sotto un estrattore di caratteristiche video nominato.Quanto sono vicine le distribuzioni di caratteristiche video generate e di riferimento sotto un protocollo di campionamento clip fisso? Un valore più basso è migliore solo all'interno dello stesso dataset, estrattore di caratteristiche, durata del clip, frame rate, pre-elaborazione e protocollo di campionamento.Un singolo clip di output non è un risultato FVD difendibile a livello di distribuzione. FVD non isola l'identità sorgente, la conservazione degli attributi target, la sincronizzazione labiale o un difetto temporale specifico.
Coerenza del soggetto e dello sfondoCoerenza delle caratteristiche attraverso i fotogrammi di output e rispetto ai fotogrammi precedenti, target o di riferimento.Quanto sono stabili le caratteristiche del soggetto e dello sfondo attraverso il movimento sotto il protocollo video fisso? Una maggiore coerenza è solitamente migliore sotto la stessa implementazione.La coerenza da sola non può stabilire una corretta mappatura dell'identità, realismo visivo, accuratezza del movimento o prontezza per la pubblicazione.
Diagnostica di sguardo, apertura degli occhi, sincronizzazione labiale e movimentoComportamento nominato di occhi, audio-labiale, landmark o flusso ottico tra sequenze target e di output.Quali attributi target dinamici specifici rimangono sincronizzati attraverso il video generato? Direzione e unità dipendono dalla diagnostica nominata; riportare ciascuna separatamente.Queste diagnostiche non sono intercambiabili, necessitano di un protocollo video documentato e non si applicano a ogni tipo di supporto.
Valutazione della qualità appresa senza riferimentoIl solo output, valutato da un modello addestrato su giudizi umani classificati o dati di qualità etichettati.Come valuta un valutatore addestrato la qualità visiva dell'output quando i supporti di riferimento espliciti non sono disponibili? La direzione dipende dall'output del modello; validarlo su una distribuzione di esclusione documentata.Le prestazioni dipendono dai dati di addestramento e dall'ambito di validazione. Un punteggio del solo output non può stabilire da solo un corretto trasferimento dell'identità sorgente.
Scorecard umana strutturataUn output visibile rispetto ad ancore di difetto esplicite, cancelli di pubblicazione e note del revisore.Quali difetti visibili o cancelli d'uso non risolti osserva un revisore in questo output specifico? Usa valutazioni ordinali ancorate; non reinterpretare il risultato come probabilità o punteggio biometrico.Evidenza soggettiva sul campione revisionato, non accuratezza del modello, classifica del fornitore, probabilità o somiglianza biometrica.

I protocolli di benchmark pubblicati non sono intercambiabili

Il crosswalk qui sotto registra solo le configurazioni descritte dai documenti primari. Non copia le loro tabelle di risultati, non afferma che ogni dataset sia scaricabile, né trasforma valori di diversi valutatori in un'unica classifica.

Protocollo e fonteUnità di confrontoMisure riportateConfine di comparabilità
CASIA FaceSwappingCoppie video sorgente-target assemblate sotto tre protocolli di isolamento dei fattori. Normale: 4.500 coppie non sovrapposte della stessa etnia da registrazioni normali. Inter-etnia: 1.200 coppie che coprono entrambe le direzioni tra gruppi asiatici, africani e caucasici. Inter-attributo: 4.300 coppie che coprono variazioni normali e di posa, espressione o illuminazione in entrambe le direzioni.recupero identità, somiglianza identità, errore di posa, errore di espressione, FID, coerenza del soggetto, coerenza dello sfondo. Nessun protocollo di revisione umana è riassunto in questo crosswalk.Le tre fette isolano diversi fattori all'interno della configurazione CASIA. I loro valori dipendono dalla costruzione delle coppie di quel documento, dai modelli, dagli estrattori di caratteristiche, dalle risoluzioni e dall'aggregazione.
IDBench-V200 coppie sorgente-video e target-immagine del mondo reale riportate nel documento. Un set di valutazione di 200 coppie che copre volti piccoli, pose estreme della testa, occlusioni severe, espressioni complesse o dinamiche e scene affollate con più persone.Somiglianza identità ArcFace, somiglianza identità InsightFace, somiglianza identità CurricularFace, varianza della somiglianza identità fotogramma per fotogramma, errore di posa, errore di espressione, coerenza dello sfondo, coerenza del soggetto, scorrevolezza del movimento, FVD. Il documento riporta 19 valutatori che utilizzano valutazioni da 1 a 5 per somiglianza identità, conservazione degli attributi e qualità video.La riga registra solo il protocollo riportato nel documento. Non afferma la disponibilità pubblica del download, non riproduce un risultato, né rende i suoi valori portabili a un altro benchmark.
CanonSwap VFS benchmark100 coppie sorgente-target campionate da VFHQ; ogni target utilizza i primi 100 fotogrammi e quattro secondi di audio corrispondente. Un set di valutazione di 100 coppie di video face swap con finestre audio e fotogrammi fisse.somiglianza identità, recupero identità, errore di posa, errore di espressione, errore di sguardo, errore del rapporto d'aspetto dell'occhio, LSE-D, LSE-C, coerenza temporale del flusso ottico, FVD. Nessun protocollo di revisione umana è riassunto in questo crosswalk.Il protocollo utilizza scelte specifiche del documento per fotogramma, audio, stimatore ed estrattore di caratteristiche. I suoi valori non devono essere confrontati direttamente con i valori di IDBench-V o CASIA.

Scarica la mappa decisionale delle metriche

Il JSON preserva tutte le 9 famiglie di metriche, il crosswalk a 3 protocolli, i prerequisiti, le direzioni di interpretazione, i confini di evidenza e le fonti primarie. Il CSV contiene la tabella delle famiglie di metriche; il record BibTeX fornisce un'attribuzione stabile.

Usa l'evidenza giusta per la decisione: le metriche automatizzate necessitano di un dataset fisso, valutatore, pipeline di pre-elaborazione, conteggio campioni e output ripetuti. Questa scheda di valutazione locale registra i difetti visibili in un risultato revisionato e deliberatamente non imita un benchmark automatizzato.

Rendi ogni revisione riproducibile abbastanza da permettere a un'altra persona di ispezionarla

  1. Scegli il tipo di output e identifica il campione. Seleziona foto, video o GIF e registra un identificatore del campione, revisore e data di revisione.
  2. Conferma i tre critici gate di pubblicazione. Conferma l'autorizzazione, verifica la mappatura dell'identità prevista e verifica se è necessaria una divulgazione di contenuti AI.
  3. Rivedi ogni criterio applicabile. Valuta identità, confine del volto, posa ed espressione, illuminazione, occlusione, integrità tecnica e stabilità temporale dove applicabile.
  4. Leggi il risultato ponderato senza ignorare i gate. Usa il risultato per dare priorità alle correzioni. Un punteggio numerico non ignora mai cancelli di autorizzazione, mappatura o divulgazione irrisolti.
  5. Esporta la registrazione completa delle prove. Scarica JSON o CSV, conserva le note e ripeti lo stesso protocollo per ogni output che intendi confrontare.
I confronti tra fornitori necessitano di più prove: utilizzare input consentiti identici, esecuzioni indipendenti ripetute, più revisori, condizioni di visione documentate e reportistica statistica. Un singolo output scelto a mano non può stabilire la qualità media del modello.

La revisione soggettiva è utile solo quando i suoi limiti sono visibili

Confine

Il punteggio è un'osservazione umana strutturata di un singolo output revisionato, non una misurazione biometrica dell'identità.

Confine

La rubrica non stabilisce l'accuratezza del modello, la qualità media, la sicurezza, la velocità, l'affidabilità o la superiorità del fornitore.

Confine

Un punteggio alto non sostituisce il consenso, la divulgazione, la revisione legale, di accessibilità o specifica per il pubblico.

Confine

Un'affermazione tra fornitori richiede gli stessi input, esecuzioni ripetute, revisori indipendenti, condizioni di visione documentate e reportistica statistica.

Cosa il numero può e non può stabilire

Questo carica i miei media o appunti?

No. La pagina non ha input multimediali e i controlli della scheda di valutazione non inviano valutazioni o appunti a DeepSwapAI.

È un punteggio di identità biometrica?

No. È un'osservazione umana documentata delle caratteristiche visibili dell'output, non l'accuratezza del riconoscimento facciale o la similarità dell'embedding.

Un singolo punteggio può classificare i fornitori di face swap?

No. Un confronto difendibile necessita di input condivisi, output ripetuti, più revisori, condizioni di visione controllate e reportistica statistica.

Perché la stabilità temporale è esclusa dalle foto?

Un'immagine fissa non ha una sequenza di fotogrammi. La modalità foto normalizza i sei criteri applicabili da 90 punti base a 100.

Posso riutilizzare la rubrica?

Sì. La JSON pubblicata e la CSV vuota utilizzano CC BY 4.0 e includono la dichiarazione di attribuzione richiesta e un record BibTeX scaricabile.

Il FID può misurare un singolo output di face swap?

No. Il FID confronta distribuzioni di set di immagini generate e di riferimento. Una singola immagine non è una distribuzione.

L'identità dovrebbe essere confrontata con la fonte o con il target?

Il recupero dell'identità e la similarità normalmente confrontano l'output con la fonte. La conservazione della posa e dell'espressione normalmente confrontano l'output con il target.

I valori di CASIA FaceSwapping, IDBench-V e CanonSwap possono essere confrontati direttamente?

No. La loro costruzione delle coppie, le sezioni di sfida, i valutatori, gli estrattori di caratteristiche, le finestre di fotogrammi o audio, la pre-elaborazione e l'aggregazione differiscono. Riprodurre un protocollo condiviso prima di confrontare i valori.

Inizia face swap

Face swap IA nel browser per foto, batch, mappature di gruppo, video e GIF autorizzati.

Inizia face swap