Scheda qualità
Scheda qualità
Scheda qualità. Face swap IA nel browser per foto, batch, mappature di gruppo, video e GIF autorizzati. Conteúdo localizado: it. Confronto verificato dalle fonti.
Guida pratica
Scheda qualità
Questa pagina spiega Scheda qualità in italiano: scopo, limiti e verifica. Il corpo revisionato conserva fatti, numeri, link e fonti; usa solo media autorizzati.
Confronto verificato dalle fonti: Face swap IA nel browser per foto, batch, mappature di gruppo, video e GIF autorizzati.
Risposta diretta
Un punteggio di qualità del face swap necessita di criteri visibili e un confine di evidenza
Questa scheda di valutazione struttura una revisione umana di un output specifico. Non ispeziona biometricamente un volto, non predice un risultato non visto, né trasforma un singolo campione favorevole in un'affermazione su un intero modello o fornitore.
Valutazione interattiva
Valuta un output con lo stesso standard
Scegli il tipo di supporto, completa i cancelli, valuta ogni criterio applicabile e conserva una breve nota di evidenza per qualsiasi cosa un altro revisore dovrebbe essere in grado di trovare.
Ancore di valutazione
Usa lo stesso significato da 0 a 4 per ogni criterio
La scala descrive il difetto più forte osservato nel materiale campionato per quel criterio. Non è un punteggio di confidenza, probabilità o misura biometrica.
| Valutazione | Ancora | Definizione |
|---|---|---|
| 0 | Inutilizzabile | Un fallimento o un difetto grave impedisce l'uso previsto. |
| 1 | Difetto maggiore | Un difetto chiaramente visibile domina la visione normale. |
| 2 | Difetto evidente | Un difetto rimane facile da notare e necessita di una correzione mirata. |
| 3 | Difetto minore | Un piccolo difetto è visibile in revisione ma non domina la visione normale. |
| 4 | Nessun difetto materiale osservato | Nessun difetto materiale è stato osservato nell'output campionato per questo criterio. |
Dimensioni della rubrica
I pesi sono espliciti e il movimento viene valutato solo quando esiste
Video e GIF utilizzano tutti i 100 punti di peso base. La foto esclude la stabilità temporale e normalizza i restanti 90 punti a un risultato di 100 punti.
| Criterio | Peso base | Supporto | Domanda di revisione |
|---|---|---|---|
| Preservazione dell'identità | 24% | foto, video, gif | Occhi visibili, sopracciglia, naso, bocca, mascella, indizi di età e identità complessiva rimangono coerenti con il riferimento previsto? |
| Confine del volto e fusione | 16% | foto, video, gif | La texture della pelle, i bordi del viso, le orecchie, la mascella, l'attaccatura dei capelli e il collo si fondono nella scena target senza un confine incollato? |
| Coerenza di posa ed espressione | 14% | foto, video, gif | La geometria facciale rimane coerente con l'angolazione della testa target, lo sguardo, lo stato degli occhi, la forma della bocca e l'espressione? |
| Continuità di illuminazione e colore | 14% | foto, video, gif | Esposizione, colore, ombreggiatura della pelle, luci e ombre rimangono coerenti con la scena target? |
| Continuità di occlusione e accessori | 12% | foto, video, gif | Capelli, mani, occhiali, maschere, microfoni, oggetti in primo piano e altre occlusioni rimangono nel corretto ordine visivo? |
| Integrità tecnica | 10% | foto, video, gif | L'output è privo di sfocatura materiale, ringing, artefatti a blocchi, strappi, caratteristiche duplicate, cambiamenti bruschi di texture o fotogrammi danneggiati? |
| Stabilità temporale | 10% | video, gif | Nel movimento, l'identità rimane stabile senza sfarfallio, deriva, perdita del volto, cambiamenti improvvisi di geometria o una cucitura di loop visibile? |
Scarica il protocollo riutilizzabile
Il JSON contiene la scala completa, i cancelli, i criteri, la formula, le bande decisionali, i limiti di evidenza, la licenza e i riferimenti. Il CSV è un modello di revisione vuoto a sette righe e il file BibTeX fornisce una citazione stabile.
Mappa del benchmark automatizzato
Le metriche di qualità del face swap rispondono a domande diverse
Un benchmark difendibile mantiene separati il trasferimento dell'identità sorgente, la conservazione degli attributi target, il realismo della distribuzione di immagini e video, il comportamento fotogramma per fotogramma, la valutazione del solo output e la revisione umana. La mappa decisionale con versione nomina cosa confronta ogni famiglia e il protocollo necessario prima che un valore possa essere interpretato.
| Misura | Confronta | Uso | Confine |
|---|---|---|---|
| Somiglianza di recupero dell'identità o embedding | Identità sorgente rispetto all'output scambiato, utilizzando un encoder facciale nominato o una galleria sorgente. | Quanto fortemente l'output conserva l'evidenza dell'identità sorgente sotto il valutatore fisso? Una maggiore somiglianza o prestazioni di recupero sono solitamente migliori all'interno dello stesso protocollo. | L'encoder, il ritaglio, la galleria, i dati demografici, la soglia e la pre-elaborazione influenzano il valore. Non è un verdetto biometrico per una singola persona. |
| Stabilità della somiglianza dell'identità fotogramma per fotogramma | La sequenza delle somiglianze di identità da sorgente a output attraverso i fotogrammi di output rilevati sotto un encoder facciale nominato. | L'evidenza dell'identità sorgente rimane stabile al variare di posa, espressione, occlusione e condizioni della scena nel tempo? Una minore dispersione può indicare una maggiore stabilità solo quando la somiglianza media dell'identità o il risultato di recupero sono riportati accanto. | Un'identità costantemente errata può avere una varianza bassa. La dispersione non può sostituire la somiglianza media o il recupero, e i valori non sono portabili tra encoder o pipeline di fotogrammi. |
| Errore di posa ed espressione | Stime di posa o espressione target rispetto all'output scambiato sotto uno stimatore nominato. | Quanto fedelmente l'output preserva la posa della testa target e l'espressione sotto lo stimatore fisso? Un errore minore è solitamente migliore all'interno dello stesso stimatore e parametrizzazione. | I valori non sono portabili tra diversi stimatori, ritagli, spazi dei parametri, convenzioni dei landmark o pipeline di pre-elaborazione. |
| Frechet Inception Distance (FID) | Una distribuzione di immagini o fotogrammi generati rispetto a una distribuzione di riferimento documentata. | Quanto sono vicine due distribuzioni di caratteristiche sotto l'estrattore di caratteristiche fisso e il protocollo di campionamento? Un valore più basso è migliore solo all'interno dello stesso dataset, estrattore, pre-elaborazione e protocollo di campionamento. | Un singolo output di face swap non può avere un FID difendibile perché una singola immagine non è una distribuzione. FID non isola la correttezza dell'identità. |
| Frechet Video Distance (FVD) | Una distribuzione di clip video generati rispetto a una distribuzione di clip di riferimento documentata sotto un estrattore di caratteristiche video nominato. | Quanto sono vicine le distribuzioni di caratteristiche video generate e di riferimento sotto un protocollo di campionamento clip fisso? Un valore più basso è migliore solo all'interno dello stesso dataset, estrattore di caratteristiche, durata del clip, frame rate, pre-elaborazione e protocollo di campionamento. | Un singolo clip di output non è un risultato FVD difendibile a livello di distribuzione. FVD non isola l'identità sorgente, la conservazione degli attributi target, la sincronizzazione labiale o un difetto temporale specifico. |
| Coerenza del soggetto e dello sfondo | Coerenza delle caratteristiche attraverso i fotogrammi di output e rispetto ai fotogrammi precedenti, target o di riferimento. | Quanto sono stabili le caratteristiche del soggetto e dello sfondo attraverso il movimento sotto il protocollo video fisso? Una maggiore coerenza è solitamente migliore sotto la stessa implementazione. | La coerenza da sola non può stabilire una corretta mappatura dell'identità, realismo visivo, accuratezza del movimento o prontezza per la pubblicazione. |
| Diagnostica di sguardo, apertura degli occhi, sincronizzazione labiale e movimento | Comportamento nominato di occhi, audio-labiale, landmark o flusso ottico tra sequenze target e di output. | Quali attributi target dinamici specifici rimangono sincronizzati attraverso il video generato? Direzione e unità dipendono dalla diagnostica nominata; riportare ciascuna separatamente. | Queste diagnostiche non sono intercambiabili, necessitano di un protocollo video documentato e non si applicano a ogni tipo di supporto. |
| Valutazione della qualità appresa senza riferimento | Il solo output, valutato da un modello addestrato su giudizi umani classificati o dati di qualità etichettati. | Come valuta un valutatore addestrato la qualità visiva dell'output quando i supporti di riferimento espliciti non sono disponibili? La direzione dipende dall'output del modello; validarlo su una distribuzione di esclusione documentata. | Le prestazioni dipendono dai dati di addestramento e dall'ambito di validazione. Un punteggio del solo output non può stabilire da solo un corretto trasferimento dell'identità sorgente. |
| Scorecard umana strutturata | Un output visibile rispetto ad ancore di difetto esplicite, cancelli di pubblicazione e note del revisore. | Quali difetti visibili o cancelli d'uso non risolti osserva un revisore in questo output specifico? Usa valutazioni ordinali ancorate; non reinterpretare il risultato come probabilità o punteggio biometrico. | Evidenza soggettiva sul campione revisionato, non accuratezza del modello, classifica del fornitore, probabilità o somiglianza biometrica. |
I protocolli di benchmark pubblicati non sono intercambiabili
Il crosswalk qui sotto registra solo le configurazioni descritte dai documenti primari. Non copia le loro tabelle di risultati, non afferma che ogni dataset sia scaricabile, né trasforma valori di diversi valutatori in un'unica classifica.
| Protocollo e fonte | Unità di confronto | Misure riportate | Confine di comparabilità |
|---|---|---|---|
| CASIA FaceSwapping | Coppie video sorgente-target assemblate sotto tre protocolli di isolamento dei fattori. Normale: 4.500 coppie non sovrapposte della stessa etnia da registrazioni normali. Inter-etnia: 1.200 coppie che coprono entrambe le direzioni tra gruppi asiatici, africani e caucasici. Inter-attributo: 4.300 coppie che coprono variazioni normali e di posa, espressione o illuminazione in entrambe le direzioni. | recupero identità, somiglianza identità, errore di posa, errore di espressione, FID, coerenza del soggetto, coerenza dello sfondo. Nessun protocollo di revisione umana è riassunto in questo crosswalk. | Le tre fette isolano diversi fattori all'interno della configurazione CASIA. I loro valori dipendono dalla costruzione delle coppie di quel documento, dai modelli, dagli estrattori di caratteristiche, dalle risoluzioni e dall'aggregazione. |
| IDBench-V | 200 coppie sorgente-video e target-immagine del mondo reale riportate nel documento. Un set di valutazione di 200 coppie che copre volti piccoli, pose estreme della testa, occlusioni severe, espressioni complesse o dinamiche e scene affollate con più persone. | Somiglianza identità ArcFace, somiglianza identità InsightFace, somiglianza identità CurricularFace, varianza della somiglianza identità fotogramma per fotogramma, errore di posa, errore di espressione, coerenza dello sfondo, coerenza del soggetto, scorrevolezza del movimento, FVD. Il documento riporta 19 valutatori che utilizzano valutazioni da 1 a 5 per somiglianza identità, conservazione degli attributi e qualità video. | La riga registra solo il protocollo riportato nel documento. Non afferma la disponibilità pubblica del download, non riproduce un risultato, né rende i suoi valori portabili a un altro benchmark. |
| CanonSwap VFS benchmark | 100 coppie sorgente-target campionate da VFHQ; ogni target utilizza i primi 100 fotogrammi e quattro secondi di audio corrispondente. Un set di valutazione di 100 coppie di video face swap con finestre audio e fotogrammi fisse. | somiglianza identità, recupero identità, errore di posa, errore di espressione, errore di sguardo, errore del rapporto d'aspetto dell'occhio, LSE-D, LSE-C, coerenza temporale del flusso ottico, FVD. Nessun protocollo di revisione umana è riassunto in questo crosswalk. | Il protocollo utilizza scelte specifiche del documento per fotogramma, audio, stimatore ed estrattore di caratteristiche. I suoi valori non devono essere confrontati direttamente con i valori di IDBench-V o CASIA. |
Scarica la mappa decisionale delle metriche
Il JSON preserva tutte le 9 famiglie di metriche, il crosswalk a 3 protocolli, i prerequisiti, le direzioni di interpretazione, i confini di evidenza e le fonti primarie. Il CSV contiene la tabella delle famiglie di metriche; il record BibTeX fornisce un'attribuzione stabile.
Protocollo di valutazione in cinque passaggi
Rendi ogni revisione riproducibile abbastanza da permettere a un'altra persona di ispezionarla
- Scegli il tipo di output e identifica il campione. Seleziona foto, video o GIF e registra un identificatore del campione, revisore e data di revisione.
- Conferma i tre critici gate di pubblicazione. Conferma l'autorizzazione, verifica la mappatura dell'identità prevista e verifica se è necessaria una divulgazione di contenuti AI.
- Rivedi ogni criterio applicabile. Valuta identità, confine del volto, posa ed espressione, illuminazione, occlusione, integrità tecnica e stabilità temporale dove applicabile.
- Leggi il risultato ponderato senza ignorare i gate. Usa il risultato per dare priorità alle correzioni. Un punteggio numerico non ignora mai cancelli di autorizzazione, mappatura o divulgazione irrisolti.
- Esporta la registrazione completa delle prove. Scarica JSON o CSV, conserva le note e ripeti lo stesso protocollo per ogni output che intendi confrontare.
Limiti delle prove e fonti
La revisione soggettiva è utile solo quando i suoi limiti sono visibili
Confine
Il punteggio è un'osservazione umana strutturata di un singolo output revisionato, non una misurazione biometrica dell'identità.
Confine
La rubrica non stabilisce l'accuratezza del modello, la qualità media, la sicurezza, la velocità, l'affidabilità o la superiorità del fornitore.
Confine
Un punteggio alto non sostituisce il consenso, la divulgazione, la revisione legale, di accessibilità o specifica per il pubblico.
Confine
Un'affermazione tra fornitori richiede gli stessi input, esecuzioni ripetute, revisori indipendenti, condizioni di visione documentate e reportistica statistica.
- ITU-R BT.500-15: Methodologies for the subjective assessment of the quality of television images - Principi generali per la valutazione soggettiva documentata delle immagini; la rubrica DeepSwapAI non è un test di laboratorio ITU.
- ITU-T P.910 (10/2023): Subjective video quality assessment methods for multimedia applications - Principi generali per la valutazione soggettiva documentata multimediale; la rubrica DeepSwapAI è un flusso di lavoro pratico di revisione singola.
- Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark - Definisce il benchmark CASIA FaceSwapping e documenta i protocolli di identità, attributo-target, distribuzione e coerenza video.
- DreamID-V: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer - Introduce il protocollo IDBench-V a 200 coppie e riporta misure di similarità dell'identità multi-encoder, varianza fotogramma per fotogramma, attributo-target, coerenza video, FVD e misure di revisione umana.
- CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation - Riporta misure specifiche del video di identità, attributo-target, sincronizzazione, coerenza temporale e distribuzione.
- Rank-based No-reference Quality Assessment for Face Swapping - Studia la valutazione della qualità del face-swap appresa solo sull'output confrontata con giudizi classificati.
- GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium - Introduce la Frechet Inception Distance come misura di valutazione a livello di distribuzione.
- Ricerca sulla prontezza dell'input controllato DeepSwapAI - prove separate solo sull'input senza punteggio dell'output generato.
- Specchio della scheda di valutazione pubblica con versione - la copia v1.6.2 nel repository di ricerca aperto.
- Rilascio di ricerca aperto verificato tramite checksum - manifest, checksum SHA-256, file di citazione, JSON e CSV.
- Istantanea del repository Software Heritage - conservata indipendentemente come swh:
1: .snp: f11738615eea 9f999c8709a0 da73130f0426 6209 - Metodologia di verifica delle affermazioni DeepSwapAI - come vengono revisionati i fatti sul prodotto, i confronti e i limiti delle prove.
Domande sulla scheda di valutazione
Cosa il numero può e non può stabilire
Questo carica i miei media o appunti?
No. La pagina non ha input multimediali e i controlli della scheda di valutazione non inviano valutazioni o appunti a DeepSwapAI.
È un punteggio di identità biometrica?
No. È un'osservazione umana documentata delle caratteristiche visibili dell'output, non l'accuratezza del riconoscimento facciale o la similarità dell'embedding.
Un singolo punteggio può classificare i fornitori di face swap?
No. Un confronto difendibile necessita di input condivisi, output ripetuti, più revisori, condizioni di visione controllate e reportistica statistica.
Perché la stabilità temporale è esclusa dalle foto?
Un'immagine fissa non ha una sequenza di fotogrammi. La modalità foto normalizza i sei criteri applicabili da 90 punti base a 100.
Posso riutilizzare la rubrica?
Sì. La JSON pubblicata e la CSV vuota utilizzano CC BY 4.0 e includono la dichiarazione di attribuzione richiesta e un record BibTeX scaricabile.
Il FID può misurare un singolo output di face swap?
No. Il FID confronta distribuzioni di set di immagini generate e di riferimento. Una singola immagine non è una distribuzione.
L'identità dovrebbe essere confrontata con la fonte o con il target?
Il recupero dell'identità e la similarità normalmente confrontano l'output con la fonte. La conservazione della posa e dell'espressione normalmente confrontano l'output con il target.
I valori di CASIA FaceSwapping, IDBench-V e CanonSwap possono essere confrontati direttamente?
No. La loro costruzione delle coppie, le sezioni di sfida, i valutatori, gli estrattori di caratteristiche, le finestre di fotogrammi o audio, la pre-elaborazione e l'aggregazione differiscono. Riprodurre un protocollo condiviso prima di confrontare i valori.
Inizia face swap
Face swap IA nel browser per foto, batch, mappature di gruppo, video e GIF autorizzati.