Gratis menselijke-beoordelingsprotocol
Face swap-kwaliteitsscorecard voor foto's, video's en GIF's
Beoordeel één gegenereerde uitvoer met zeven zichtbare criteria, drie kritieke publicatiepoorten en een transparante gewogen formule. Breng vervolgens de beoordeling in kaart met negen metriekfamilies en drie gepubliceerde videobenchmarkprotocollen zonder incompatibele scores als equivalent te behandelen.
Direct antwoord
Een face swap-kwaliteitsscore heeft zichtbare criteria en een bewijsgrens nodig
Deze scorecard structureert een menselijke beoordeling van één specifieke uitvoer. Het inspecteert een gezicht niet biometrisch, voorspelt geen onzichtbaar resultaat of verandert één gunstig monster niet in een claim over een heel model of aanbieder.
Interactieve evaluatie
Beoordeel één uitvoer met dezelfde standaard
Kies het mediatype, voltooi de poorten, beoordeel elk toepasbaar criterium en bewaar een korte bewijsnotitie voor alles wat een andere beoordelaar zou moeten kunnen vinden.
Beoordelingsankers
Gebruik dezelfde 0-tot-4 betekenis voor elk criterium
De schaal beschrijft het sterkste defect dat is waargenomen in het bemonsterde materiaal voor dat criterium. Het is geen vertrouwensscore, waarschijnlijkheid of biometrische meting.
| Beoordeling | Anker | Definitie |
|---|---|---|
| 0 | Onbruikbaar | Een fout of ernstig defect verhindert het beoogde gebruik. |
| 1 | Groot defect | Een duidelijk zichtbaar defect domineert normaal kijken. |
| 2 | Merkbaar defect | Een defect blijft gemakkelijk opvallen en vereist gerichte correctie. |
| 3 | Klein defect | Een klein defect is zichtbaar bij beoordeling maar domineert normaal kijken niet. |
| 4 | Geen materieel defect waargenomen | Er is geen materieel defect waargenomen in de gesamplede uitvoer voor dit criterium. |
Rubricdimensies
Gewichten zijn expliciet en beweging wordt alleen gescoord wanneer beweging bestaat
Video en GIF gebruiken alle 100 basisgewichtpunten. Foto sluit temporele stabiliteit uit en normaliseert de resterende 90 punten naar een 100-puntsresultaat.
| Criterium | Basisgewicht | Media | Beoordelingsvraag |
|---|---|---|---|
| Identiteitsbehoud | 24% | foto, video, gif | Blijven de zichtbare ogen, wenkbrauwen, neus, mond, kaak, leeftijdskenmerken en algehele identiteit coherent met de beoogde referentie? |
| Gezichtsrand en overgang | 16% | foto, video, gif | Gaan huidtextuur, gezichtsranden, oren, kaak, haarlijn en nek over in de doelscene zonder een opgeplakte rand? |
| Pose- en expressiecoherentie | 14% | foto, video, gif | Blijft gezichtsgeometrie coherent met de doelhoek van het hoofd, blik, oogtoestand, mondvorm en expressie? |
| Verlichtings- en kleurcontinuïteit | 14% | foto, video, gif | Blijven belichting, kleur, huidschaduw, hooglichten en schaduwen consistent met de doelscene? |
| Occlusie- en accessoirecontinuïteit | 12% | foto, video, gif | Blijven haar, handen, brillen, maskers, microfoons, voorgrondobjecten en andere occlusies in de juiste visuele volgorde? |
| Technische integriteit | 10% | foto, video, gif | Is de uitvoer vrij van materiële vervaging, ringing, blokartefacten, scheuren, dubbele kenmerken, abrupte textuurveranderingen of beschadigde frames? |
| Temporele stabiliteit | 10% | video, gif | Blijft identiteit stabiel tijdens beweging zonder flikkering, drift, gezichtsverlies, plotselinge geometrieveranderingen of een zichtbare lusnaad? |
Download het herbruikbare protocol
De JSON bevat de volledige schaal, poorten, criteria, formule, beslissingsbanden, bewijslimieten, licentie en referenties. De CSV is een lege zevenrijige beoordelingssjabloon en het BibTeX-bestand biedt een stabiele citatie.
Geautomatiseerde benchmarkkaart
Metrieken voor kwaliteit van gezichtswissel beantwoorden verschillende vragen
Een verdedigbare benchmark houdt bron-identiteitsoverdracht, doel-kenmerkbehoud, realisme van beeld- en videodistributie, frame-tot-frame gedrag, alleen-uitvoer beoordeling en menselijke beoordeling gescheiden. De versiebeheerde beslissingskaart benoemt wat elke familie vergelijkt en het protocol dat nodig is voordat een waarde kan worden geïnterpreteerd.
| Meten | Vergelijkt | Gebruik | Grens |
|---|---|---|---|
| Identiteitsophaling of inbeddingsgelijkenis | Bronidentiteit versus de gewisselde uitvoer, met behulp van een benoemde gezichtsencoder of bronverzameling. | Hoe sterk behoudt de uitvoer bron-identiteitsbewijs onder de vaste evaluator? Hogere gelijkenis of retrievalprestatie is meestal beter binnen hetzelfde protocol. | De encoder, uitsnede, verzameling, demografie, drempelwaarde en voorbewerking beïnvloeden de waarde. Het is geen biometrisch oordeel voor één persoon. |
| Framegewijze identiteitsgelijkenisstabiliteit | De reeks van bron-naar-uitvoer identiteitsgelijkenissen over gedetecteerde uitvoerframes onder één benoemde gezichtsencoder. | Blijft bron-identiteitsbewijs stabiel terwijl pose, expressie, occlusie en scèneomstandigheden in de loop van de tijd veranderen? Lagere spreiding kan duiden op grotere stabiliteit alleen wanneer de gemiddelde identiteitsgelijkenis of retrievalresultaat ernaast wordt gerapporteerd. | Een consistent verkeerde identiteit kan een lage variantie hebben. Spreiding kan gemiddelde gelijkenis of retrieval niet vervangen, en waarden zijn niet overdraagbaar tussen encoders of framepijplijnen. |
| Houding- en expressiefout | Doel-pose- of expressieschattingen versus de gewisselde uitvoer onder een benoemde schatter. | Hoe nauwkeurig behoudt de uitvoer de doel-hoofdpose en expressie onder de vaste schatter? Lagere fout is meestal beter binnen dezelfde schatter en parametrisering. | Waarden zijn niet overdraagbaar tussen verschillende schatters, uitsneden, parameterruimtes, oriëntatiepuntconventies of voorbewerkingspijplijnen. |
| Frechet Inception Distance (FID) | Een distributie van gegenereerde afbeeldingen of frames versus een gedocumenteerde referentiedistributie. | Hoe dicht liggen twee kenmerkdistributies bij elkaar onder de vaste kenmerkextractor en bemonsteringsprotocol? Lager is alleen beter binnen dezelfde dataset, extractor, voorbewerking en monsterprotocol. | Eén gezichtswisseluitvoer kan geen verdedigbare FID hebben omdat een enkele afbeelding geen distributie is. FID isoleert identiteitscorrectheid niet. |
| Frechet Video Distance (FVD) | Een distributie van gegenereerde videoclips versus een gedocumenteerde referentieclip-distributie onder een benoemde video-kenmerkextractor. | Hoe dicht liggen gegenereerde en referentie video-kenmerkdistributies bij elkaar onder één vast clip-bemonsteringsprotocol? Lager is alleen beter binnen dezelfde dataset, kenmerkextractor, clipduur, framerate, voorbewerking en monsterprotocol. | Eén uitvoerclip is geen verdedigbaar distributieniveau FVD-resultaat. FVD isoleert bronidentiteit, doel-kenmerkbehoud, lipsynchronisatie of een specifiek temporeel defect niet. |
| Onderwerp- en achtergrondconsistentie | Kenmerkconsistentie over uitvoerframes en tegen voorgaande, doel- of referentieframes. | Hoe stabiel zijn onderwerp- en achtergrondkenmerken door beweging heen onder het vaste videoprotocol? Hogere consistentie is meestal beter onder dezelfde implementatie. | Consistentie alleen kan geen correcte identiteitsmapping, visueel realisme, bewegingsnauwkeurigheid of publicatiegereedheid vaststellen. |
| Kijkrichting, oogopening, lipsynchronisatie en bewegingsdiagnostiek | Benoemd oog-, audio-lip-, oriëntatiepunt- of optische-stroomgedrag tussen doel- en uitvoerreeksen. | Welke specifieke dynamische doelkenmerken blijven gesynchroniseerd door de gegenereerde video? Richting en eenheid hangen af van de benoemde diagnostiek; rapporteer elke apart. | Deze diagnostieken zijn niet uitwisselbaar, hebben een gedocumenteerd videoprotocol nodig en zijn niet van toepassing op elk mediatype. |
| Geleerde geen-referentie kwaliteitsbeoordeling | De uitvoer alleen, geëvalueerd door een model getraind op gerangschikte menselijke oordelen of gelabelde kwaliteitsgegevens. | Hoe rangschikt een getrainde beoordelaar de zichtbare uitvoerkwaliteit wanneer expliciete referentiemedia ontbreken? Richting hangt af van de modeluitvoer; valideer het op een gedocumenteerde vastgehouden distributie. | Prestaties hangen af van trainingsgegevens en validatieomvang. Een alleen-uitvoer score kan geen correcte bronidentiteitsoverdracht op zichzelf vaststellen. |
| Gestructureerde menselijke scorecard | Eén zichtbare uitvoer tegen expliciete defectankers, publicatiepoorten en beoordelaarsnotities. | Welke zichtbare defecten of onopgeloste gebruikspoorten observeert een beoordelaar in deze specifieke uitvoer? Gebruik verankerde ordinale beoordelingen; herinterpreteer het resultaat niet als een waarschijnlijkheid of biometrische score. | Subjectief bewijs over het beoordeelde monster, niet modelnauwkeurigheid, aanbiederrangschikking, waarschijnlijkheid of biometrische gelijkenis. |
Gepubliceerde benchmarkprotocollen zijn niet uitwisselbaar
De onderstaande kruisverwijzing registreert alleen de opstellingen beschreven door de primaire papers. Het kopieert hun resultatentabellen niet, beweert niet dat elke dataset downloadbaar is, of zet waarden van verschillende evaluatoren om in één leaderboard.
| Protocol en bron | Vergelijkingseenheid | Gerapporteerde metingen | Vergelijkbaarheidsgrens |
|---|---|---|---|
| CASIA FaceSwapping | Bron-doel videoparen samengesteld onder drie factor-isolatieprotocollen. Normaal: 4.500 niet-overlappende paren van dezelfde etniciteit uit normale opnames. Cross-etniciteit: 1.200 paren die beide richtingen overspannen tussen Aziatische, Afrikaanse en Kaukasische groepen. Cross-kenmerk: 4.300 paren die normale en pose-, expressie- of belichtingsvariaties in beide richtingen overspannen. | identiteitsretrieval, identiteitsgelijkenis, posefout, expressiefout, FID, onderwerpconsistentie, achtergrondconsistentie. Geen menselijk beoordelingsprotocol is samengevat in deze kruisverwijzing. | De drie segmenten isoleren verschillende factoren binnen de CASIA-opstelling. Hun waarden hangen af van de paarconstructie, modellen, kenmerkextractoren, resoluties en aggregatie van dat paper. |
| IDBench-V | 200 paper-gerapporteerde real-world bron-video- en doel-afbeeldingsparen. Eén 200-paar evaluatieset die kleine gezichten, extreme hoofdhoudingen, ernstige occlusies, complexe of dynamische expressies en rommelige multi-persoonsscènes dekt. | ArcFace identiteitsgelijkenis, InsightFace identiteitsgelijkenis, CurricularFace identiteitsgelijkenis, frame-gewijze identiteitsgelijkenisvariantie, posefout, expressiefout, achtergrondconsistentie, onderwerpconsistentie, bewegingsgladheid, FVD. Het paper rapporteert 19 evaluatoren die 1-tot-5 beoordelingen gebruiken voor identiteitsgelijkenis, kenmerkbehoud en videokwaliteit. | De rij registreert alleen het paper-gerapporteerde protocol. Het beweert geen openbare downloadbeschikbaarheid, reproduceert geen resultaat, of maakt zijn waarden overdraagbaar naar een andere benchmark. |
| CanonSwap VFS benchmark | 100 bron-doel paren gesampled uit VFHQ; elk doel gebruikt de eerste 100 frames en vier seconden van bijbehorende audio. Eén 100-paar video gezichtswissel evaluatieset met vaste frame- en audiovensters. | identiteitsgelijkenis, identiteitsretrieval, posefout, expressiefout, blikfout, oogaspectverhoudingsfout, LSE-D, LSE-C, optische-stroom temporele consistentie, FVD. Geen menselijk beoordelingsprotocol is samengevat in deze kruisverwijzing. | Het protocol gebruikt paperspecifieke frame-, audio-, schatter- en kenmerkextractorkeuzes. De waarden mogen niet direct worden vergeleken met IDBench-V of CASIA waarden. |
Download de metrische beslissingskaart
De JSON behoudt alle 9 metrische families, de 3-protocol kruisverwijzing, vereisten, interpretatierichtingen, bewijsgrenzen en primaire bronnen. De CSV bevat de metrische-familie tabel; het BibTeX-record biedt stabiele toeschrijving.
Vijfstappen evaluatieprotocol
Maak elke beoordeling reproduceerbaar genoeg voor een andere persoon om te inspecteren
- Kies het uitvoertype en identificeer het monster. Selecteer foto, video of GIF en noteer een monsteridentificatie, beoordelaar en beoordelingsdatum.
- Bevestig de drie kritische publicatiepoorten. Bevestig toestemming, verifieer de beoogde identiteitstoewijzing en beoordeel of een AI-inhoudsopenbaarmaking nodig is.
- Beoordeel elk toepasselijk criterium. Beoordeel identiteit, gezichtsgrens, houding en expressie, belichting, occlusie, technische integriteit en temporele stabiliteit waar van toepassing.
- Lees het gewogen resultaat zonder de poorten te overschrijven. Gebruik het resultaat om correcties te prioriteren. Een numerieke score overschrijft nooit onopgeloste toestemmings-, toewijzings- of openbaarmakingspoorten.
- Exporteer het volledige bewijsrecord. Download JSON of CSV, behoud notities en herhaal hetzelfde protocol voor elke uitvoer die u wilt vergelijken.
Bewijsgrens en bronnen
Subjectieve beoordeling is alleen nuttig wanneer de grenzen zichtbaar zijn
Grens
De score is een gestructureerde menselijke observatie van één beoordeelde uitvoer, geen biometrische identiteitsmeting.
Grens
De rubric stelt geen modelnauwkeurigheid, gemiddelde kwaliteit, veiligheid, snelheid, betrouwbaarheid of aanbiedersuperioriteit vast.
Grens
Een hoge score vervangt geen toestemming, openbaarmaking, juridische, toegankelijkheids- of doelgroepspecifieke beoordeling.
Grens
Een claim over aanbieders vereist dezelfde invoer, herhaalde runs, onafhankelijke beoordelaars, gedocumenteerde kijkomstandigheden en statistische rapportage.
- ITU-R BT.500-15: Methodologies for the subjective assessment of the quality of television images - Algemene principes voor gedocumenteerde subjectieve beeldbeoordeling; de DeepSwapAI rubric is geen ITU-laboratoriumtest.
- ITU-T P.910 (10/2023): Subjective video quality assessment methods for multimedia applications - Algemene principes voor gedocumenteerde subjectieve multimediabeoordeling; de DeepSwapAI rubric is een praktische enkele-beoordeling werkstroom.
- Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark - Definieert de CASIA FaceSwapping benchmark en documenteert identiteits-, doel-kenmerk-, distributie- en videoconsistentieprotocollen.
- DreamID-V: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer - Introduceert het 200-paar IDBench-V protocol en rapporteert multi-encoder identiteitsgelijkenis, frame-gewijze variantie, doel-kenmerk-, video-consistentie-, FVD- en menselijke-beoordelingsmetingen.
- CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation - Rapporteert videospecifieke identiteits-, doel-kenmerk-, synchronisatie-, temporele consistentie- en distributiemetingen.
- Rank-based No-reference Quality Assessment for Face Swapping - Bestudeert geleerde alleen-uitvoer gezichtswissel kwaliteitsbeoordeling getraind tegen gerangschikte menselijke oordelen.
- GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium - Introduceert Frechet Inception Distance als een distributieniveau evaluatiemaatstaf.
- DeepSwapAI gecontroleerd invoer-gereedheid onderzoek - scheid alleen-invoer bewijs zonder gegenereerde-uitvoer score.
- Canonieke scorecarddataset - huidige JSON gepubliceerd door de canonieke website.
- Onderzoeksmanifest met gecontroleerde checksum - bytegroottes en SHA-256-controlesommen voor 17 canonieke bestanden.
- Historische software-erfgoedrepositorymomentopname - de v1.6.2 status onafhankelijk bewaard als swh:
1: .snp: f11738615eea 9f999c8709a0 da73130f0426 6209 - DeepSwapAI claimverificatiemethodologie - hoe productfeiten, vergelijkingen en bewijsgrenzen worden beoordeeld.
Scorekaartvragen
Wat het getal wel en niet kan vaststellen
Uploadt dit mijn media of notities?
Nee. De pagina heeft geen media-invoer en scorekaartbedieningselementen sturen geen beoordelingen of notities naar DeepSwapAI.
Is dit een biometrische identiteitsscore?
Nee. Het is een gedocumenteerde menselijke observatie van zichtbare uitvoerkenmerken, geen gezichtsherkenningsnauwkeurigheid of inbeddingsgelijkenis.
Kan één score gezichtswisselaanbieders rangschikken?
Nee. Een verdedigbare vergelijking heeft gedeelde invoeren, herhaalde uitvoeren, meerdere beoordelaars, gecontroleerde kijkomstandigheden en statistische rapportage nodig.
Waarom is temporele stabiliteit uitgesloten van foto's?
Een stilstaand beeld heeft geen framereeks. Fotomodus normaliseert de zes toepasselijke criteria van 90 basisgewichtspunten naar 100.
Kan ik de rubric hergebruiken?
Ja. De gepubliceerde JSON en blanco CSV gebruiken CC BY 4.0 en bevatten de vereiste toeschrijvingsverklaring en een downloadbaar BibTeX-record.
Kan FID één gezichtswisseluitvoer meten?
Nee. FID vergelijkt distributies van gegenereerde en referentie afbeeldingssets. Eén afbeelding is geen distributie.
Moet identiteit worden vergeleken met de bron of het doel?
Identiteitsretrieval en gelijkenis vergelijken normaal de uitvoer met de bron. Pose- en expressiebehoud vergelijken normaal de uitvoer met het doel.
Kunnen CASIA FaceSwapping, IDBench-V en CanonSwap waarden direct worden vergeleken?
Nee. Hun paarconstructie, uitdagingssegmenten, evaluatoren, kenmerkextractoren, frame- of audiovensters, voorbewerking en aggregatie verschillen. Reproduceer één gedeeld protocol voordat u waarden vergelijkt.
Genereer eerst de kleinste representatieve uitvoer
Kies één toegestaan doel en identiteitsreferentie, genereer één representatief resultaat en keer dan terug om het te scoren voordat u een batch of lange clip schaalt.