Free human-review protocol

Bedömningstabell för ansiktsbyteskvalitet för foton, videor och GIF

Betygsätt en genererad utgång med sju synliga kriterier, tre kritiska publiceringsgrindar och en transparent viktad formel. Mappa sedan granskningen till nio metriska familjer och tre publicerade videobenchmark-protokoll utan att behandla inkompatibla poäng som likvärdiga.

Av DeepSwapAI ProduktteamSida och granskningshjul uppdaterad 26 augusti; protokoll publicerat 18 juli och benchmark-korsreferens granskad 28 juli 2026Human-review protocol

Ett ansiktsbyteskvalitetsbetyg behöver synliga kriterier och en bevisgräns

Denna bedömningstabell strukturerar en mänsklig granskning av en specifik utgång. Den inspekterar inte ett ansikte biometriskt, förutsäger inte ett osett resultat eller förvandlar ett gynnsamt prov till ett påstående om en hel modell eller leverantör.

7 visible criteriaIdentitet, blandning, position, ljus, ocklusion, teknisk integritet och rörelsestabilitet.
3 critical gatesTillstånd, avsedd identitetsmappning och publiceringsavslöjande förblir separata från siffran.
0 uploaded review dataSidan accepterar ingen mediafil. Betyg, anteckningar, beräkning och export stannar i denna webbläsarflik.
Återanvändbar visuell checklista: Bedömningstabell för ansiktsbyteskvalitet för foton, videor och GIF
Ett ansiktsbyteskvalitetsbetyg behöver synliga kriterier och en bevisgränsLadda ned SVGCC BY 4.0Erkännande: DeepSwapAI Product Team, https://deepswapai.com/sv/face-swap-quality-scorecard
Bädda in bilden

Kopiera denna HTML för att hänvisa till originalsidan.

Betygsätt en utgång med samma standard

Välj mediatyp, slutför grindarna, betygsätt varje tillämpligt kriterium och behåll en kort bevisanteckning för allt en annan granskare borde kunna hitta.

Runs locally
Output type
Critical publication gates

Ett betyg kan inte åsidosätta en olöst grind.

Rate the visible output

Använd 0 för en oanvändbar defekt och 4 endast när inget materialfel observeras i det granskade provet.

IdentitetsbevarandeÄr de synliga ögonen, ögonbrynen, näsan, munnen, käken, ålderssignalerna och den övergripande identiteten sammanhängande med den avsedda referensen?24% basvikt · Granska vid normal visningsstorlek, inspektera sedan ansiktet under den svåraste synliga posen eller bildrutan.
Ansiktsgräns och blandningÖvergår hudstruktur, ansiktskanter, öron, käke, hårfäste och nacke smidigt in i målscenen utan en påklistrad gräns?16% basvikt · Inspektera högkontrastkanter och hela ansiktskonturen snarare än endast mitten av ansiktet.
Positions- och uttryckskoherensFörblir ansiktsgeometrin koherent med målhuvudets vinkel, blick, ögonstatus, munform och uttryck?14% basvikt · Prioritera profilvridningar, slutna ögon, öppna munnar, leenden och branta huvudlutningar.
Ljus- och färgkontinuitetFörblir exponering, färg, hudskuggning, högdagrar och skuggor konsekventa med målsituationen?14% basvikt · Kontrollera riktat ljus, färgat ljus, skugggränser och övergångar mellan ljusa och mörka områden.
Ocklusions- och accessoarkontinuitetFörblir hår, händer, glasögon, masker, mikrofoner, förgrundsobjekt och andra ocklusioner i korrekt visuell ordning?12% basvikt · Granska varje punkt där ett objekt korsar ansiktet eller där ansiktet rör sig bakom ett annat objekt.
Technical integrityÄr utgången fri från materiell oskärpa, ringning, blockartefakter, rivning, dubbla egenskaper, abrupta texturförändringar eller skadade bildrutor?10% basvikt · Inspektera i avsedd leveransstorlek och undvik att behandla avsiktlig rörelseoskärpa eller skärpedjup som en defekt i sig.
Temporal stabilityFörblir identiteten stabil över rörelse utan flimmer, drift, ansiktsförlust, plötsliga geometriförändringar eller en synlig loop-söm?10% basvikt · Granska hela klippet i normal hastighet, spela sedan upp den svåraste svängen, ocklusionen, klippet och loopgränsen bild för bild.

Använd samma 0-till-4-betydelse för varje kriterium

Skalan beskriver den starkaste defekten som observerats i det provtagna materialet för det kriteriet. Det är inte en konfidenspoäng, sannolikhet eller biometrisk mätning.

BetygAnkareDefinition
0OanvändbarEtt fel eller allvarlig defekt förhindrar den avsedda användningen.
1Stor defektEn tydligt synlig defekt dominerar normal visning.
2Märkbar defektEn defekt är fortfarande lätt att märka och behöver riktad korrigering.
3Mindre defektEn liten defekt är synlig vid granskning men dominerar inte normal visning.
4Ingen väsentlig defekt observeradIngen väsentlig defekt observerades i det samplade resultatet för detta kriterium.

Vikter är explicita och rörelse poängsätts endast när rörelse finns

Video och GIF använder alla 100 basvikts-poäng. Foto exkluderar temporal stabilitet och normaliserar de återstående 90 poängen till ett 100-poängsresultat.

KriteriumBasviktMediaGranskningsfråga
Identitetsbevarande24%foto, video, gifÄr de synliga ögonen, ögonbrynen, näsan, munnen, käken, ålderssignalerna och den övergripande identiteten sammanhängande med den avsedda referensen?
Ansiktsgräns och blandning16%foto, video, gifÖvergår hudstruktur, ansiktskanter, öron, käke, hårfäste och nacke smidigt in i målscenen utan en påklistrad gräns?
Positions- och uttryckskoherens14%foto, video, gifFörblir ansiktsgeometrin koherent med målhuvudets vinkel, blick, ögonstatus, munform och uttryck?
Ljus- och färgkontinuitet14%foto, video, gifFörblir exponering, färg, hudskuggning, högdagrar och skuggor konsekventa med målsituationen?
Ocklusions- och accessoarkontinuitet12%foto, video, gifFörblir hår, händer, glasögon, masker, mikrofoner, förgrundsobjekt och andra ocklusioner i korrekt visuell ordning?
Technical integrity10%foto, video, gifÄr utgången fri från materiell oskärpa, ringning, blockartefakter, rivning, dubbla egenskaper, abrupta texturförändringar eller skadade bildrutor?
Temporal stability10%video, gifFörblir identiteten stabil över rörelse utan flimmer, drift, ansiktsförlust, plötsliga geometriförändringar eller en synlig loop-söm?

Ladda ner det återanvändbara protokollet

JSON innehåller den fullständiga skalan, grindar, kriterier, formel, beslutband, bevisgränser, licens och referenser. CSV är en tom granskningsmall med sju rader, och BibTeX-filen ger en stabil citering.

Kvalitetsmått för ansiktsbyte svarar på olika frågor

En försvarbar benchmark håller källidentitetsöverföring, målattributbevarande, bild- och videodistributionsrealism, bild-till-bild-beteende, endast-utdata-bedömning och mänsklig granskning åtskilda. Den versionshanterade beslutskartan namnger vad varje familj jämför och vilket protokoll som behövs innan ett värde kan tolkas.

MåttJämförAnvändGräns
Identitetsåtervinning eller inbäddningslikhetKällidentitet kontra det bytta resultatet, med en namngiven ansiktskodare eller källgalleri.Hur starkt behåller utdata källidentitetsbevis under den fasta utvärderaren? Högre likhet eller sökprestanda är vanligtvis bättre inom samma protokoll.Kodaren, beskärningen, galleriet, demografin, tröskeln och förbehandlingen påverkar värdet. Det är inte ett biometriskt utslag för en person.
Bildruta-för-bildruta identitetslikhetsstabilitetSekvensen av käll-till-utdata identitetslikheter över detekterade utdataramar under en namngiven ansiktskodare.Förblir källidentitetsbevis stabilt när posé, uttryck, ocklusion och scenförhållanden förändras över tid? Lägre spridning kan indikera större stabilitet endast när medelidentitetslikheten eller sökresultatet rapporteras bredvid.En konsekvent felaktig identitet kan ha låg varians. Spridning kan inte ersätta medellikhet eller sökning, och värden är inte portabla över kodare eller rampipelines.
Pose and expression errorMålposé- eller uttrycksskattningar kontra det bytta resultatet under en namngiven skattare.Hur noggrant bevarar utdata målhuvudets posé och uttryck under den fasta skattaren? Lägre fel är vanligtvis bättre inom samma skattare och parameterisering.Värden är inte portabla över olika skattare, beskärningar, parameterutrymmen, landmärkeskonventioner eller förbehandlingspipelines.
Frechet Inception Distance (FID)En distribution av genererade bilder eller ramar kontra en dokumenterad referensdistribution.Hur nära är två egenskapsdistributioner under den fasta egenskapsextraktorn och provtagningsprotokollet? Lägre är bättre endast inom samma dataset, extraktor, förbehandling och provprotokoll.Ett ansiktsbytesutdata kan inte ha ett försvarbart FID eftersom en enskild bild inte är en distribution. FID isolerar inte identitetskorrekthet.
Frechet Video Distance (FVD)En distribution av genererade videoklipp kontra en dokumenterad referensklippdistribution under en namngiven videoegenskapsextraktor.Hur nära är genererade och referensvideoegenskapsdistributioner under ett fast klipp-provtagningsprotokoll? Lägre är bättre endast inom samma dataset, egenskapsextraktor, klipplängd, bildhastighet, förbehandling och provprotokoll.Ett utdataklipp är inte ett försvarbart distributionsnivå-FVD-resultat. FVD isolerar inte källidentitet, målattributbevarande, läppsynkronisering eller en specifik temporal defekt.
Subjekt- och bakgrundskonsistensEgenskapskonsistens över utdataramar och mot föregående, mål- eller referensramar.Hur stabila är motiv- och bakgrundsegenskaper genom rörelse under det fasta videoprotokollet? Högre konsistens är vanligtvis bättre under samma implementering.Konsistens ensam kan inte etablera korrekt identitetsmappning, visuell realism, rörelsenoggrannhet eller publiceringsberedskap.
Blick, ögonöppning, läppsynk och rörelsediagnostikNamngivet ögon-, ljud-läpp-, landmärkes- eller optiskt flödesbeteende mellan mål- och utdatasekvenser.Vilka specifika dynamiska målattribut förblir synkroniserade genom den genererade videon? Riktning och enhet beror på den namngivna diagnostiken; rapportera varje separat.Dessa diagnostiker är inte utbytbara, behöver ett dokumenterat videoprotokoll och gäller inte för varje mediatyp.
Inlärd ingen-referens kvalitetsbedömningUtdata ensamt, utvärderat av en modell tränad mot rankade mänskliga bedömningar eller märkt kvalitetsdata.Hur rankar en tränad bedömare synlig utdatakvalitet när explicita referensmedia inte är tillgängliga? Riktning beror på modellens utdata; validera den på en dokumenterad hållen distribution.Prestanda beror på träningsdata och valideringsomfång. En endast-utdata-poäng kan inte etablera korrekt källidentitetsöverföring av sig själv.
Structured human scorecardEtt synligt utdata mot explicita defektankare, publiceringsgrindar och granskningsanteckningar.Vilka synliga defekter eller olösta användningsgrindar observerar en granskare i detta specifika utdata? Använd förankrade ordinalbetyg; omtolka inte resultatet som en sannolikhet eller biometrisk poäng.Subjektivt bevis om det granskade provet, inte modellnoggrannhet, leverantörsranking, sannolikhet eller biometrisk likhet.

Publicerade benchmarkprotokoll är inte utbytbara

Korsreferensen nedan registrerar endast de uppsättningar som beskrivs av primärartiklarna. Den kopierar inte deras resultattabeller, påstår inte att varje dataset är nedladdningsbar eller omvandlar värden från olika utvärderare till en ledartavla.

Protokoll och källaJämförelseenhetRapporterade måttJämförbarhetsgräns
CASIA FaceSwappingKäll-mål-videopar sammansatta under tre faktor-isoleringsprotokoll. Normal: 4 500 icke-överlappande par av samma etnicitet från normala inspelningar. Kors-etnicitet: 1 200 par som spänner över båda riktningarna mellan asiatiska, afrikanska och kaukasiska grupper. Kors-attribut: 4 300 par som spänner över normala och posé-, uttrycks- eller belysningsvariationer i båda riktningarna.identitetsökning, identitetslikhet, poséfel, uttrycksfel, FID, motivkonsistens, bakgrundskonsistens. Inget mänskligt granskningsprotokoll sammanfattas i denna korsreferens.De tre skivorna isolerar olika faktorer inom CASIA-uppsättningen. Deras värden beror på den artikelns parkonstruktion, modeller, egenskapsextraktorer, upplösningar och aggregering.
IDBench-V200 artikelrapporterade verkliga källvideo- och målbildspar. En 200-pars utvärderingsuppsättning som täcker små ansikten, extrema huvudposéer, svåra ocklusioner, komplexa eller dynamiska uttryck och röriga scener med flera personer.ArcFace identitetslikhet, InsightFace identitetslikhet, CurricularFace identitetslikhet, bildrutevis identitetslikhetsvarians, poséfel, uttrycksfel, bakgrundskonsistens, motivkonsistens, rörelsejämnhet, FVD. Artikeln rapporterar 19 utvärderare med 1-till-5-betyg för identitetslikhet, attributbevarande och videokvalitet.Raden registrerar endast det artikelrapporterade protokollet. Den hävdar inte offentlig nedladdningstillgänglighet, återger inte ett resultat eller gör dess värden portabla till en annan benchmark.
CanonSwap VFS benchmark100 käll-mål-par samplade från VFHQ; varje mål använder de första 100 bildrutorna och fyra sekunder av motsvarande ljud. En 100-pars videoansiktsbytesutvärderingsuppsättning med fasta bildrute- och ljudfönster.identitetslikhet, identitetsökning, poséfel, uttrycksfel, blickfel, ögonaspektkvotfel, LSE-D, LSE-C, optiskt flöde temporal konsistens, FVD. Inget mänskligt granskningsprotokoll sammanfattas i denna korsreferens.Protokollet använder artikelspecifika bildrute-, ljud-, skattar- och egenskapsextraktorsval. Dess värden får inte jämföras direkt med IDBench-V- eller CASIA-värden.

Ladda ner den metriska besluts kartan

JSON bevarar alla 9 metriska familjer, 3-protokollskorsreferensen, förutsättningar, tolkningsriktningar, bevisgränser och primära källor. CSV innehåller den metriska familjetabellen; BibTeX-posten ger stabil tillskrivning.

Använd rätt bevis för beslutet: automatiserade mått behöver en fast dataset, utvärderare, förbehandlingspipeline, provantal och upprepade utdata. Detta lokala poängkort registrerar synliga defekter i ett granskat resultat och imiterar medvetet inte en automatiserad benchmark.

Gör varje granskning tillräckligt reproducerbar för att en annan person ska kunna inspektera

  1. Välj utdatatyp och identifiera provet. Välj foto, video eller GIF och registrera en providentifierare, granskare och granskningsdatum.
  2. Bekräfta de tre kritiska publiceringsgrindarna. Bekräfta tillstånd, verifiera den avsedda identitetsmappningen och granska om ett AI-innehållsavslöjande behövs.
  3. Granska varje tillämpligt kriterium. Betygsätt identitet, ansiktsgräns, position och uttryck, ljus, ocklusion, teknisk integritet och temporal stabilitet där tillämpligt.
  4. Läs det viktade resultatet utan att åsidosätta grindarna. Använd resultatet för att prioritera korrigeringar. Ett numeriskt betyg åsidosätter aldrig olösta tillstånds-, mappnings- eller avslöjandegrindar.
  5. Exportera den fullständiga bevisposten. Ladda ner JSON eller CSV, behåll anteckningar och upprepa samma protokoll för varje utgång du avser att jämföra.
Leverantörsjämförelser behöver mer bevis: använd identiska tillåtna indata, upprepade oberoende körningar, flera granskare, dokumenterade visningsförhållanden och statistisk rapportering. Ett handplockat utdata kan inte etablera genomsnittlig modellkvalitet.

Subjektiv granskning är användbar endast när dess gränser är synliga

Gräns

Betyget är en strukturerad mänsklig observation av en granskad utgång, inte ett biometriskt identitetsmått.

Gräns

Bedömningsmallen fastställer inte modellnoggrannhet, genomsnittlig kvalitet, säkerhet, hastighet, tillförlitlighet eller leverantörsöverlägsenhet.

Gräns

Ett högt betyg ersätter inte samtycke, avslöjande, juridisk, tillgänglighets- eller målgruppsspecifik granskning.

Gräns

Ett påstående mellan leverantörer kräver samma indata, upprepade körningar, oberoende granskare, dokumenterade visningsförhållanden och statistisk rapportering.

Vad numret kan och inte kan etablera

Laddar denna sida upp min media eller anteckningar?

Nej. Sidan har ingen mediainmatning, och poängkortskontroller skickar inte betyg eller anteckningar till DeepSwapAI.

Är detta en biometrisk identitetspoäng?

Nej. Det är en dokumenterad mänsklig observation av synliga utdataegenskaper, inte ansiktsigenkänningsnoggrannhet eller inbäddningslikhet.

Kan en poäng rangordna ansiktsbytesleverantörer?

Nej. En försvarbar jämförelse behöver delade indata, upprepade utdata, flera granskare, kontrollerade visningsförhållanden och statistisk rapportering.

Varför är temporal stabilitet exkluderad från foton?

En stillbild har ingen bildrutessekvens. Fotomod normaliserar de sex tillämpliga kriterierna från 90 basvikts-poäng till 100.

Can I reuse the rubric?

Ja. Den publicerade JSON och tomma CSV använder CC BY 4.0 och inkluderar den nödvändiga tillskrivningsförklaringen och en nedladdningsbar BibTeX-post.

Kan FID mäta ett ansiktsbytesutdata?

Nej. FID jämför distributioner av genererade och referensbilduppsättningar. En bild är inte en distribution.

Bör identitet jämföras med källan eller målet?

Identitetsökning och likhet jämför normalt utdata med källan. Posé- och uttrycksbevarande jämför normalt utdata med målet.

Kan CASIA FaceSwapping-, IDBench-V- och CanonSwap-värden jämföras direkt?

Nej. Deras parkonstruktion, utmaningsskivor, utvärderare, egenskapsextraktorer, bildrute- eller ljudfönster, förbehandling och aggregering skiljer sig. Återskapa ett delat protokoll innan du jämför värden.

Generera det minsta representativa utdata först

Välj ett tillåtet mål och identitetsreferens, generera ett representativt resultat, återvänd sedan för att poängsätta det innan du skalar en batch eller ett långt klipp.

Öppna fotoansiktsbyte