Libreng protocol ng pagsusuri ng tao
Face swap quality scorecard para sa mga larawan, video, at GIF
I-rate ang isang generated output na may pitong visible criteria, tatlong critical publication gates, at isang transparent weighted formula. Pagkatapos ay i-map ang review sa siyam na metric families at tatlong published video benchmark protocols nang hindi tinatrato ang mga hindi tugmang score bilang katumbas.
Direktang sagot
Ang isang face swap quality score ay nangangailangan ng visible criteria at isang evidence boundary
Ang scorecard na ito ay nagbubuo ng isang human review ng isang partikular na output. Hindi nito sinusuri ang isang mukha nang biometrically, hinuhulaan ang isang hindi nakikitang resulta, o ginagawang isang claim ang isang paborableng sample tungkol sa isang buong modelo o provider.
Interactive evaluation
I-score ang isang output gamit ang parehong pamantayan
Piliin ang uri ng media, kumpletuhin ang mga gates, i-rate ang bawat applicable criterion, at panatilihin ang isang maikling evidence note para sa anumang bagay na dapat mahanap ng ibang reviewer.
Rating anchors
Gamitin ang parehong 0-to-4 na kahulugan para sa bawat criterion
Ang scale ay naglalarawan ng pinakamalakas na depekto na naobserbahan sa sampled material para sa criterion na iyon. Ito ay hindi isang confidence score, probability, o biometric measurement.
| Rating | Anchor | Kahulugan |
|---|---|---|
| 0 | Unusable | Ang isang pagkabigo o malubhang depekto ay pumipigil sa nilalayong paggamit. |
| 1 | Major defect | Ang isang malinaw na nakikitang depekto ay nangingibabaw sa normal na pagtingin. |
| 2 | Noticeable defect | Ang isang depekto ay nananatiling madaling mapansin at nangangailangan ng nakatutok na pagwawasto. |
| 3 | Minor defect | Ang isang maliit na depekto ay nakikita sa pagsusuri ngunit hindi nangingibabaw sa normal na pagtingin. |
| 4 | Walang nakitang makabuluhang depekto | Walang materyal na depekto ang naobserbahan sa sample na output para sa pamantayang ito. |
Rubric dimensions
Ang mga timbang ay tahasan at ang motion ay isa-score lamang kapag may motion
Ang video at GIF ay gumagamit ng lahat ng 100 base-weight points. Ang photo ay hindi kasama ang temporal stability at ini-normalize ang natitirang 90 points sa isang 100-point result.
| Criterion | Base weight | Media | Review question |
|---|---|---|---|
| Pagpapanatili ng pagkakakilanlan | 24% | larawan, video, gif | Ang nakikitang mga mata, kilay, ilong, bibig, panga, tanda ng edad, at pangkalahatang pagkakakilanlan ba ay nananatiling tugma sa nilalayong sanggunian? |
| Hangganan at pag-blend ng mukha | 16% | larawan, video, gif | Ang texture ng balat, gilid ng mukha, tainga, panga, hairline, at leeg ba ay lumilipat sa target na eksena nang walang parang idinikit na hangganan? |
| Pagkakatugma ng pose at ekspresyon | 14% | larawan, video, gif | Ang geometry ba ng mukha ay nananatiling tugma sa target na anggulo ng ulo, tingin, estado ng mata, hugis ng bibig, at ekspresyon? |
| Pagpapatuloy ng ilaw at kulay | 14% | larawan, video, gif | Ang exposure, kulay, pagtatabing ng balat, mga highlight, at mga anino ba ay nananatiling pare-pareho sa target na eksena? |
| Pagbara at patuloy na accessory | 12% | larawan, video, gif | Ang buhok, kamay, salamin, maskara, mikropono, mga bagay sa harapan, at iba pang pagbara ba ay nananatili sa tamang visual na pagkakasunod-sunod? |
| Teknikal na integridad | 10% | larawan, video, gif | Ang output ba ay malaya mula sa materyal na blur, ringing, block artifacts, tearing, duplicate features, biglaang pagbabago sa texture, o mga nasirang frame? |
| Temporal na katatagan | 10% | video, gif | Sa paggalaw, nananatili bang matatag ang pagkakakilanlan nang walang flicker, drift, pagkawala ng mukha, biglaang pagbabago sa heometriya, o nakikitang loop seam? |
I-download ang reusable protocol
Ang JSON ay naglalaman ng kumpletong scale, gates, criteria, formula, decision bands, evidence limits, license, at references. Ang CSV ay isang blankong seven-row review template, at ang BibTeX file ay nagbibigay ng stable citation.
Mapa ng awtomatikong benchmark
Ang face swap quality metrics ay sumasagot sa iba't ibang tanong
Ang isang defensible benchmark ay naghihiwalay sa source-identity transfer, target-attribute preservation, image at video distribution realism, frame-to-frame behavior, output-only assessment, at human review. Ang versioned decision map ay nagpapangalan kung ano ang inihahambing ng bawat pamilya at ang protocol na kailangan bago mabigyang-kahulugan ang isang value.
| Measure | Compares | Gamitin | Boundary |
|---|---|---|---|
| Identity retrieval o embedding similarity | Source identity versus ang swapped output, gamit ang isang named face encoder o source gallery. | Gaano kalakas ang pagpapanatili ng output ng source-identity evidence sa ilalim ng fixed evaluator? Ang mas mataas na similarity o retrieval performance ay karaniwang mas mahusay sa loob ng parehong protocol. | Ang encoder, crop, gallery, demographics, threshold, at preprocessing ay nakakaapekto sa value. Ito ay hindi isang biometric verdict para sa isang tao. |
| Katatagan ng pagkakatulad ng pagkakakilanlan bawat frame | Ang sequence ng source-to-output identity similarities sa mga detected output frames sa ilalim ng isang named face encoder. | Nananatili bang stable ang source-identity evidence habang nagbabago ang pose, expression, occlusion, at scene conditions sa paglipas ng panahon? Ang mas mababang dispersion ay maaaring magpahiwatig ng mas malaking stability kapag ang mean identity similarity o retrieval result ay naiulat sa tabi nito. | Ang isang consistently wrong identity ay maaaring may mababang variance. Hindi mapapalitan ng dispersion ang mean similarity o retrieval, at ang mga value ay hindi portable sa iba't ibang encoder o frame pipelines. |
| Pose at expression error | Target pose o expression estimates versus ang swapped output sa ilalim ng isang named estimator. | Gaano kalapit ang pagpapanatili ng output ng target head pose at expression sa ilalim ng fixed estimator? Ang mas mababang error ay karaniwang mas mahusay sa loob ng parehong estimator at parameterization. | Ang mga value ay hindi portable sa iba't ibang estimator, crop, parameter spaces, landmark conventions, o preprocessing pipelines. |
| Frechet Inception Distance (FID) | Isang distribution ng generated images o frames versus isang documented reference distribution. | Gaano kalapit ang dalawang feature distributions sa ilalim ng fixed feature extractor at sampling protocol? Ang mas mababa ay mas mahusay lamang sa loob ng parehong dataset, extractor, preprocessing, at sample protocol. | Ang isang face swap output ay hindi maaaring magkaroon ng defensible FID dahil ang isang solong imahe ay hindi isang distribution. Hindi inihihiwalay ng FID ang identity correctness. |
| Frechet Video Distance (FVD) | Isang distribution ng generated video clips versus isang documented reference-clip distribution sa ilalim ng isang named video feature extractor. | Gaano kalapit ang generated at reference video feature distributions sa ilalim ng isang fixed clip-sampling protocol? Ang mas mababa ay mas mahusay lamang sa loob ng parehong dataset, feature extractor, clip duration, frame rate, preprocessing, at sample protocol. | Ang isang output clip ay hindi isang defensible distribution-level FVD result. Hindi inihihiwalay ng FVD ang source identity, target-attribute preservation, lip synchronization, o isang partikular na temporal defect. |
| Subject at background consistency | Feature consistency sa mga output frames at laban sa preceding, target, o reference frames. | Gaano katatag ang subject at background features sa pamamagitan ng motion sa ilalim ng fixed video protocol? Ang mas mataas na consistency ay karaniwang mas mahusay sa ilalim ng parehong implementation. | Ang consistency lamang ay hindi makapagtatag ng tamang identity mapping, visual realism, motion accuracy, o publication readiness. |
| Gaze, eye aperture, lip sync, at motion diagnostics | Named eye, audio-lip, landmark, o optical-flow behavior sa pagitan ng target at output sequences. | Aling mga partikular na dynamic target attributes ang nananatiling naka-synchronize sa pamamagitan ng generated video? Ang direksyon at unit ay nakadepende sa named diagnostic; iulat ang bawat isa nang hiwalay. | Ang mga diagnostic na ito ay hindi interchangeable, nangangailangan ng documented video protocol, at hindi nalalapat sa bawat uri ng media. |
| Natutunang pagsusuri ng kalidad na walang sanggunian | Ang output lamang, na sinusuri ng isang model na sinanay laban sa ranked human judgments o labeled quality data. | Paano nirararanggo ng isang trained assessor ang visible output quality kapag ang explicit reference media ay hindi available? Ang direksyon ay nakadepende sa model output; i-validate ito sa isang documented held-out distribution. | Ang performance ay nakadepende sa training data at validation scope. Ang isang output-only score ay hindi makapagtatag ng tamang source identity transfer nang mag-isa. |
| Nakaayos na scorecard ng tao | Isang visible output laban sa explicit defect anchors, publication gates, at reviewer notes. | Aling mga visible defects o unresolved use gates ang naoobserbahan ng isang reviewer sa partikular na output na ito? Gumamit ng anchored ordinal ratings; huwag muling bigyang-kahulugan ang resulta bilang isang probability o biometric score. | Subjective evidence tungkol sa reviewed sample, hindi model accuracy, provider ranking, probability, o biometric similarity. |
Ang mga published benchmark protocols ay hindi interchangeable
Ang crosswalk sa ibaba ay nagtatala lamang ng mga setup na inilarawan ng mga primary papers. Hindi nito kinokopya ang kanilang result tables, hindi inaangkin na ang bawat dataset ay nada-download, o ginagawang isang leaderboard ang mga value mula sa iba't ibang evaluator.
| Protocol at source | Comparison unit | Reported measures | Comparability boundary |
|---|---|---|---|
| CASIA FaceSwapping | Source-target video pairs na pinagsama-sama sa ilalim ng tatlong factor-isolation protocols. Normal: 4,500 non-overlapping same-ethnicity pairs mula sa normal recordings. Cross-ethnicity: 1,200 pairs na sumasaklaw sa parehong direksyon sa pagitan ng Asian, African, at Caucasian groups. Cross-attribute: 4,300 pairs na sumasaklaw sa normal at pose, expression, o illumination variations sa parehong direksyon. | identity retrieval, identity similarity, pose error, expression error, FID, subject consistency, background consistency. Walang human-review protocol ang summarized sa crosswalk na ito. | Ang tatlong slices ay naghihiwalay ng iba't ibang factor sa loob ng CASIA setup. Ang kanilang mga value ay nakadepende sa pair construction, models, feature extractors, resolutions, at aggregation ng papel na iyon. |
| IDBench-V | 200 paper-reported real-world source-video at target-image pairs. Isang 200-pair evaluation set na sumasaklaw sa small faces, extreme head poses, severe occlusions, complex o dynamic expressions, at cluttered multi-person scenes. | ArcFace identity similarity, InsightFace identity similarity, CurricularFace identity similarity, frame-wise identity-similarity variance, pose error, expression error, background consistency, subject consistency, motion smoothness, FVD. Ang papel ay nag-uulat ng 19 evaluators gamit ang 1-to-5 ratings para sa identity similarity, attribute preservation, at video quality. | Ang row ay nagtatala lamang ng paper-reported protocol. Hindi nito inaangkin ang public download availability, hindi nagpaparami ng resulta, o ginagawang portable ang mga value nito sa ibang benchmark. |
| CanonSwap VFS benchmark | 100 source-target pairs na na-sample mula sa VFHQ; bawat target ay gumagamit ng unang 100 frames at apat na segundo ng kaukulang audio. Isang 100-pair video face swap evaluation set na may fixed frame at audio windows. | identity similarity, identity retrieval, pose error, expression error, gaze error, eye aspect ratio error, LSE-D, LSE-C, optical-flow temporal consistency, FVD. Walang human-review protocol ang summarized sa crosswalk na ito. | Ang protocol ay gumagamit ng paper-specific frame, audio, estimator, at feature-extractor choices. Ang mga value nito ay hindi dapat direktang ikumpara sa IDBench-V o CASIA values. |
I-download ang metric decision map
Ang JSON ay nagpapanatili ng lahat ng 9 metric families, ang 3-protocol crosswalk, prerequisites, interpretation directions, evidence boundaries, at primary sources. Ang CSV ay naglalaman ng metric-family table; ang BibTeX record ay nagbibigay ng stable attribution.
Protokol ng pagsusuri na may limang hakbang
Gawing sapat na reproducible ang bawat review para sa ibang tao na siyasatin
- Piliin ang output type at tukuyin ang sample. Pumili ng photo, video, o GIF at itala ang sample identifier, reviewer, at review date.
- Kumpirmahin ang tatlong kritikal na publication gates. Kumpirmahin ang pahintulot, i-verify ang nilalayong identity mapping, at suriin kung kailangan ang isang AI-content disclosure.
- Suriin ang bawat applicable criterion. I-rate ang identity, face boundary, pose at expression, lighting, occlusion, technical integrity, at temporal stability kung saan applicable.
- Basahin ang weighted result nang hindi nilalampasan ang mga gates. Gamitin ang resulta upang unahin ang mga pagwawasto. Ang numerical score ay hindi kailanman nag-o-override sa hindi nalutas na permission, mapping, o disclosure gates.
- I-export ang kumpletong evidence record. I-download ang JSON o CSV, panatilihin ang mga tala, at ulitin ang parehong protocol para sa bawat output na balak mong ikumpara.
Evidence boundary at sources
Ang subjective review ay kapaki-pakinabang lamang kapag ang mga limitasyon nito ay nakikita
Boundary
Ang marka ay isang structured human observation ng isang na-review na output, hindi isang biometric identity measurement.
Boundary
Ang rubric ay hindi nagtatag ng model accuracy, average quality, safety, speed, reliability, o provider superiority.
Boundary
Ang mataas na marka ay hindi pumapalit sa consent, disclosure, legal, accessibility, o audience-specific na pagsusuri.
Boundary
Ang cross-provider claim ay nangangailangan ng parehong inputs, repeated runs, independent reviewers, documented viewing conditions, at statistical reporting.
- ITU-R BT.500-15: Methodologies for the subjective assessment of the quality of television images - General principles para sa documented subjective image assessment; ang DeepSwapAI rubric ay hindi isang ITU laboratory test.
- ITU-T P.910 (10/2023): Subjective video quality assessment methods for multimedia applications - General principles para sa documented subjective multimedia assessment; ang DeepSwapAI rubric ay isang praktikal na single-review workflow.
- Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark - Tinutukoy ang CASIA FaceSwapping benchmark at idodokumento ang identity, target-attribute, distribution, at video consistency protocols.
- DreamID-V: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer - Ipinapakilala ang 200-pair IDBench-V protocol at nag-uulat ng multi-encoder identity similarity, frame-wise variance, target-attribute, video-consistency, FVD, at human-review measures.
- CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation - Nag-uulat ng video-specific identity, target-attribute, synchronization, temporal consistency, at distribution measures.
- Rank-based No-reference Quality Assessment for Face Swapping - Pinag-aaralan ang learned output-only face-swap quality assessment na sinanay laban sa ranked judgments.
- GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium - Ipinapakilala ang Frechet Inception Distance bilang isang distribution-level evaluation measure.
- Pananaliksik sa kahandaan ng kontroladong input DeepSwapAI - hiwalay na input-only evidence na walang generated-output score.
- Canonical scorecard dataset - kasalukuyang JSON na inilathala ng kanonikal na website.
- Na-verify na checksum na manifest ng pananaliksik - mga sukat ng byte at SHA-256 checksum para sa 17 kanonikal na file.
- Snapshot ng repository ng Historical Software Heritage - ang v1.6.2 na estado ay independiyenteng napanatili bilang swh:
1: .snp: f11738615eea 9f999c8709a0 da73130f0426 6209 - Metodolohiya ng pagpapatunay ng paghahabol DeepSwapAI - kung paano nire-review ang product facts, comparisons, at evidence boundaries.
Scorecard questions
Ano ang kaya at hindi kaya ng numero na itatag
Ina-upload ba nito ang aking media o notes?
Hindi. Ang page ay walang media input, at ang scorecard controls ay hindi nagpapadala ng ratings o notes sa DeepSwapAI.
Ito ba ay isang biometric identity score?
Hindi. Ito ay isang documented human observation ng visible output characteristics, hindi face-recognition accuracy o embedding similarity.
Maaari bang i-rank ng isang score ang face swap providers?
Hindi. Ang isang defensible comparison ay nangangailangan ng shared inputs, repeated outputs, multiple reviewers, controlled viewing conditions, at statistical reporting.
Bakit hindi kasama ang temporal stability sa photos?
Ang isang still image ay walang frame sequence. Ang photo mode ay nag-normalize ng anim na applicable criteria mula 90 base-weight points tungo sa 100.
Maaari ko bang gamitin muli ang rubric?
Oo. Ang published JSON at blank CSV ay gumagamit ng CC BY 4.0 at kasama ang required attribution statement at isang nada-download na BibTeX record.
Maaari bang sukatin ng FID ang isang face swap output?
Hindi. Inihahambing ng FID ang distributions ng generated at reference image sets. Ang isang imahe ay hindi isang distribution.
Dapat bang ikumpara ang identity sa source o target?
Ang identity retrieval at similarity ay karaniwang nagkukumpara ng output sa source. Ang pose at expression preservation ay karaniwang nagkukumpara ng output sa target.
Maaari bang direktang ikumpara ang CASIA FaceSwapping, IDBench-V, at CanonSwap values?
Hindi. Ang kanilang pair construction, challenge slices, evaluators, feature extractors, frame o audio windows, preprocessing, at aggregation ay magkakaiba. Mag-reproduce ng isang shared protocol bago ikumpara ang mga value.
Gumawa muna ng pinakamaliit na representative output
Pumili ng isang permitted target at identity reference, gumawa ng isang representative result, pagkatapos ay bumalik upang i-score ito bago i-scale ang isang batch o long clip.