Teknikal na sanggunian na may binanggit na pinagmulan
Glosaryo ng AI face swap
Mga depinisyon sa simpleng Ingles para sa 24 na terminong ginamit sa pananaliksik at pagsusuri ng face swap, bawat isa ay may kasamang pangunahing pinagmulan at isang hangganan na pumipigil sa labis na pag-aangkin.
Direktang sagot
Ang terminolohiya ng face swap ay nangangailangan ng depinisyon at isang limitasyon
Ang isang source face ay nagbibigay ng mga pahiwatig ng pagkakakilanlan. Ang target media ay nagbibigay ng eksena at mga nilalayong non-identity na katangian. Ang detection, alignment, masking, at generation ay naglalarawan ng mga bahagi ng isang workflow; ang identity similarity, perceptual metrics, at human review ay sumasagot sa iba't ibang tanong sa pagsusuri.
Talaan ng mga termino
Pumunta sa konseptong kailangan mo
Mga pundasyon ng workflow
Mga pundasyon ng workflow
Ang mga tungkulin ng media at geometric preprocessing terms na tumutukoy kung ano ang pumapasok sa isang face-swap workflow.
Pagpapalit ng mukha
#Tinatawag ding: AI face swap, pagpapalit ng mukha
Isang computer-vision task na naglilipat ng identity cues mula sa isang source face patungo sa isang target na imahe o video habang sinusubukang panatilihin ang target attributes tulad ng pose, expression, buhok, at background.
Hangganan ng ebidensya: Ito ay isang task definition, hindi isang garantiya na ang bawat sistema ay nagpapanatili ng bawat katangian o na ang isang partikular na paggamit ay may pahintulot.
Mga pangunahing pinagmulan: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; Fine-Grained Face Swapping via Regional GAN Inversion
Pinagmulan na mukha
#Tinatawag ding: pinagmulan na identidad, sangguniang identidad
Ang tao o reference image na nagbibigay ng identity cues na nilayon para sa nabuong mukha.
Hangganan ng ebidensya: Ang source ay hindi karaniwang tumutukoy sa target scene, body, hair, pose, o background, at ang eksaktong paghahati ay depende sa pamamaraan.
Mga pangunahing pinagmulan: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; Reinforced Disentanglement for Face Swapping without Skip Connection
Target media
#Tinatawag ding: target image, target video
Ang imahe o video na nagbibigay ng eksena at ang non-identity attributes na sinusubukang panatilihin ng isang face-swap method.
Hangganan ng ebidensya: Ang mga pamamaraan ay naiiba sa kung aling mga target na katangian ang kanilang pinapanatili, kaya ang pagpapanatili ng target ay dapat suriin sa halip na ipagpalagay.
Mga pangunahing pinagmulan: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Pag-detect ng mukha
#Tinatawag ding: lokalisasyon ng mukha, pagtukoy sa lokasyon ng mukha
Ang proseso ng paghahanap ng isa o higit pang face regions sa isang imahe o video frame bago ang alignment, feature extraction, o generation.
Hangganan ng ebidensya: Ang isang nakitang rehiyon ng mukha ay hindi isang identity decision, consent check, o patunay na magtatagumpay ang susunod na pagproseso.
Mga pangunahing pinagmulan: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild
Facial landmarks
#Tinatawag ding: mga palatandaan ng mukha, mga puntong palatandaan
Tinatayang facial key points, tulad ng eye corners, ilong, at lokasyon ng bibig, na ginagamit upang ilarawan ang facial geometry para sa alignment o conditioning.
Hangganan ng ebidensya: Ang mga layout ng landmark, bilang ng punto, at mga yunit ng error ay nag-iiba ayon sa detector at protocol; hindi sila direktang mapapalitan.
Mga pangunahing pinagmulan: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild; DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion
Pag-align ng mukha
#Tinatawag ding: pag-align ng mukha, naka-align na crop ng mukha
Isang geometric normalization step na gumagamit ng natukoy na facial structure upang ilagay ang isang mukha sa isang pare-parehong crop, scale, at orientation para sa later processing.
Hangganan ng ebidensya: Ang mga alignment convention at transform ay nag-iiba, at ang isang aligned crop ay hindi nagtatatag ng pagkakakilanlan, kalidad, o pahintulot.
Mga pangunahing pinagmulan: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild; ArcFace: Additive Angular Margin Loss for Deep Face Recognition
Pagkakakilanlan at pagpapanatili
Pagkakakilanlan at pagpapanatili
Ang mga konseptong ginamit upang paghiwalayin ang source identity cues mula sa mga target na katangian na sinusubukang panatilihin ng isang resulta.
Pag-embed ng mukha
#Tinatawag ding: embedding ng identidad, vector ng tampok ng mukha
Isang natutunang numerical representation na idinisenyo upang ang facial images ay maihambing sa isang feature space sa ilalim ng isang partikular na recognition model at preprocessing protocol.
Hangganan ng ebidensya: Ang mga dimensyon ng vector, distance functions, at decision thresholds ay depende sa modelo at setup ng pagsusuri; ang isang embedding ay hindi likas na isang identity verdict o mathematically guaranteed na hindi ma-reconstruct.
Mga pangunahing pinagmulan: ArcFace: Additive Angular Margin Loss for Deep Face Recognition
Identity similarity
#Tinatawag ding: pagpapanatili ng identidad, marka ng pagpapanatili ng identidad
Isang protocol-dependent na paghahambing sa pagitan ng source-identity at output representations, karaniwang kinakalkula mula sa isang pinangalanang face encoder at similarity function.
Hangganan ng ebidensya: Ang mga marka ay hindi portable sa iba't ibang encoder, crop, dataset, threshold, o demograpiko at hindi dapat iharap bilang isang biometric verdict para sa isang output.
Mga pangunahing pinagmulan: ArcFace: Additive Angular Margin Loss for Deep Face Recognition; PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion
Pagpapanatili ng target-attribute
#Tinatawag ding: pagpapanatili ng katangian, pagkakapare-pareho ng target
Ang lawak kung saan pinapanatili ng isang resulta ang mga nilalayong katangian ng target tulad ng pose, ekspresyon, buhok, ilaw, damit, at background habang binabago ang mga pahiwatig ng pagkakakilanlan ng mukha.
Hangganan ng ebidensya: Ang mga sinusuri na katangian at estimator ay dapat pangalanan; ang isang pinagsama-samang marka ay maaaring magtago ng mga pagkabigo sa isang indibidwal na katangian.
Mga pangunahing pinagmulan: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Maskara sa mukha
#Tinatawag ding: palitan ang maskara, facial mask
Isang spatial na mapa na tumutukoy kung aling bahagi ng imahe ang maaaring mabuo, ihalo, o suriin bilang bahagi ng isang operasyon ng pagpapalit ng mukha.
Hangganan ng ebidensya: Ang pagbuo at semantika ng mask ay nag-iiba ayon sa pamamaraan; ang isang mask ay hindi sa sarili nito ay lumulutas ng occlusion, boundary, o color inconsistency.
Mga pangunahing pinagmulan: DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion; Fine-Grained Face Swapping via Regional GAN Inversion
Pag-parse ng mukha
#Tinatawag ding: facial semantic segmentation
Pag-segment ng semantiko sa antas ng pixel ng mga bahagi ng mukha at mga nakapaligid na rehiyon, tulad ng balat, mata, bibig, buhok, o background.
Hangganan ng ebidensya: Ang mga set ng label at kalidad ng segmentation ay depende sa parser at dataset, at ang mga maling rehiyon ay maaaring kumalat sa susunod na synthesis o compositing.
Mga pangunahing pinagmulan: Fine-Grained Face Swapping via Regional GAN Inversion
Paghalo sa hangganan ng mukha
#Tinatawag ding: paghahalo ng hangganan, pag-composite ng mukha
Ang hakbang ng compositing na nagpapalipat-lipat ng isang synthesize na bahagi ng mukha patungo sa target sa paligid ng kulay ng balat, mga gilid, ilaw, at kalapit na nilalaman.
Hangganan ng ebidensya: Ang isang visually smooth boundary ay hindi nagtatatag ng tamang pagkakakilanlan, natural na internal features, o pare-parehong pag-uugali sa mga frame ng video.
Mga pangunahing pinagmulan: Fine-Grained Face Swapping via Regional GAN Inversion; Reinforced Disentanglement for Face Swapping without Skip Connection
Oklusyon
#Tinatawag ding: pagkakatakip sa mukha, natatakpang mukha
Isang kondisyon kung saan ang bahagi ng mukha ay nakatago ng buhok, kamay, salamin, bagay, ibang tao, o hangganan ng imahe.
Hangganan ng ebidensya: Ang paghawak ng occlusion ay depende sa pamamaraan at eksena; ang isang benchmark ay dapat tukuyin ang apektadong rehiyon at mga kondisyon ng pagtingin.
Mga pangunahing pinagmulan: Fine-Grained Face Swapping via Regional GAN Inversion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Pose ng ulo
#Tinatawag ding: pose ng mukha, oryentasyon ng ulo
Ang tinatayang oryentasyon ng isang ulo kaugnay ng kamera, madalas na kinakatawan ng yaw, pitch, at roll o ng mga landmark at 3D parameter.
Hangganan ng ebidensya: Ang mga halaga ng pose ay depende sa estimator at coordinate convention; ang pagtutugma ng pose lamang ay hindi mahuhulaan ang pagiging makatotohanan ng output.
Mga pangunahing pinagmulan: DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion; PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion
Ekspresyon ng mukha
#Tinatawag ding: expression preservation
Ang nakikitang konpigurasyon ng mga tampok ng mukha na nauugnay sa mga emosyon tulad ng pagngiti, pagkurap, o pagbuka ng bibig, madalas na itinuturing na isang target na katangian sa pagpapalit ng mukha.
Hangganan ng ebidensya: Ang mga label at parameter ng ekspresyon ay depende sa estimator at maaaring makaligtaan ang banayad, asymmetric, o kultural na interpretadong pag-uugali.
Mga pangunahing pinagmulan: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Pagkakapare-pareho ng video
Pagkakapare-pareho ng video
Mga konsepto ng galaw at pagkakasunod-sunod ng frame na hindi umiiral sa isang solong still image.
Pagkakapare-pareho sa temporal
#Tinatawag ding: temporal na pagkakaugnay, pagkakapare-pareho sa bawat frame
Ang katatagan ng mga pahiwatig ng pagkakakilanlan, mga target na katangian, at visual na detalye sa magkakasunod na mga frame ng video sa halip na sa isang nakahiwalay na frame.
Hangganan ng ebidensya: Ang isang mataas na sukatan ng pagkakapare-pareho ay maaaring patuloy na mapanatili ang maling resulta, kaya ang kawastuhan ng pagkakakilanlan at nakikitang kalidad ay dapat suriin nang hiwalay.
Mga pangunahing pinagmulan: DynamicFace: High-Quality and Consistent Face Swapping for Image and Video; CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation
Optical flow
#Tinatawag ding: larangan ng galaw, pagtutugma ng mga pixel
Isang tinatayang siksik na motion field na nagmamapa ng mga lokasyon ng imahe sa pagitan ng mga frame at maaaring sumuporta sa pagsusuri ng galaw, warping, o temporal na diagnostic.
Hangganan ng ebidensya: Ang optical flow ay isang pagtatantya na maaaring mabigo sa paligid ng occlusion, blur, pagbabago ng ilaw, at mga bagong nakikitang rehiyon; ito ay hindi isang quality score sa sarili nito.
Mga pangunahing pinagmulan: RAFT: Recurrent All-Pairs Field Transforms for Optical Flow; CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation
Pagsusuri
Pagsusuri
Mga sukatan at protocol ng pagsusuri na sumasagot sa iba't ibang tanong sa kalidad sa ilalim ng mga tahasang kondisyon.
Structural Similarity Index (SSIM)
#Tinatawag ding: SSIM
Isang sukatan ng pagkakatulad ng imahe na may buong sanggunian na naghahambing ng luminance, contrast, at istraktura sa pagitan ng isang test image at isang reference image.
Hangganan ng ebidensya: Ang SSIM ay nangangailangan ng isang makabuluhang aligned reference, ay hindi partikular sa mukha, at ang halaga nito ay depende sa scale, windowing, color handling, at preprocessing.
Mga pangunahing pinagmulan: Image Quality Assessment: From Error Visibility to Structural Similarity
Learned Perceptual Image Patch Similarity (LPIPS)
#Tinatawag ding: LPIPS, natutunang perceptual na pagkakatulad
Isang perceptual na distansya batay sa mga deep network features na sinuri laban sa mga paghuhusga ng tao sa pagkakatulad ng image patch.
Hangganan ng ebidensya: Ang LPIPS ay hindi isang identity score; ang mga halaga ay depende sa napiling network, calibration, paghahanda ng imahe, at protocol ng paghahambing.
Mga pangunahing pinagmulan: The Unreasonable Effectiveness of Deep Features as a Perceptual Metric
Frechet Inception Distance (FID)
#Tinatawag ding: FID
Isang set-level na distansya sa pagitan ng mga distribusyon ng feature mula sa mga koleksyon ng generated at reference na imahe, orihinal na kinakalkula gamit ang Inception features.
Hangganan ng ebidensya: Ang FID ay hindi isang maipagtatanggol na isahang-marka ng larawan, at ang mga resulta ay nakadepende sa bilang ng sample, feature extractor, preprocessing, reference set, at implementasyon.
Mga pangunahing pinagmulan: GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium; Rethinking FID: Towards a Better Evaluation Metric for Image Generation
Walang-reperensyang pagsusuri ng kalidad
#Tinatawag ding: NR-IQA, pagtatasa ng kalidad ng imahe nang walang sanggunian
Isang pamamaraan na tinatantya ang visual na kalidad mula sa isang output nang hindi nangangailangan ng isang paired pristine reference image.
Hangganan ng ebidensya: Ang bisa nito ay nakadepende sa training data at validation design; ang isang marka ay maaaring mabigo sa mga hindi pa nakikitang pamamaraan, nilalaman, o distortion.
Mga pangunahing pinagmulan: Rank-based No-reference Quality Assessment for Face Swapping
Human-review scorecard
#Tinatawag ding: rubrik ng pagsusuri ng tao, rubrik ng pagsusuri ng output
Isang nauulit na rubric na humihiling sa isang tagasuri na itala ang mga nakikitang pamantayan, rating anchors, critical gates, at mga tala para sa isang partikular na output.
Hangganan ng ebidensya: Nagtatala ito ng mga structured na obserbasyon ng tao, hindi ang katumpakan ng modelo, biometric identity, probabilidad, o ranggo sa buong provider.
Mga pangunahing pinagmulan: DeepSwapAI marka ng kalidad ng output ng face swap; Rank-based No-reference Quality Assessment for Face Swapping
Provenance
Provenance
Mga pamantayan sa pagtatala kung saan nanggaling ang digital content at kung ano ang nangyari dito.
C2PA
#Tinatawag ding: Koalisyon para sa Pinagmulan at Pagiging Totoo ng Nilalaman
Isang bukas na teknikal na pamantayan para sa pagtatala ng tamper-evident provenance na impormasyon tungkol sa digital na nilalaman sa pamamagitan ng signed manifests, assertions, ingredients, at claims.
Hangganan ng ebidensya: Ang C2PA ay maaaring magbigay ng ebidensya ng provenance at tamper signals, ngunit ang spec ay hindi tumutukoy kung ang nilalarawang content ay totoo, tumpak, o etikal na pinahihintulutan.
Mga pangunahing pinagmulan: C2PA Technical Specification 2.4; C2PA Explainer 2.3
Content Credentials
#Tinatawag ding: C2PA Content Credentials, mga kredensyal ng pinagmulan ng nilalaman
Ang presentasyon ng provenance na impormasyon na nakaharap sa gumagamit na nauugnay sa isang digital asset sa pamamagitan ng C2PA ecosystem.
Hangganan ng ebidensya: Ang availability at ipinapakitang detalye ay nakadepende sa credential, signer, validator, asset, at platform; ang isang credential ay hindi isang deklarasyon na ang content ay makatotohanan.
Mga pangunahing pinagmulan: C2PA Explainer 2.3; C2PA Technical Specification 2.4
Interpretasyon ng sukatan
Apat na patakaran upang maiwasan ang nakakalinlang na paghahambing
Pangalanan ang relasyon
Karaniwang inihahambing ng identity metrics ang output sa source identity. Karaniwang inihahambing ng pose at expression preservation ang output sa target. Ang mga ito ay magkakaibang tanong.
Panatilihing pare-pareho ang protocol
Ang dataset, crop, evaluator, preprocessing, implementasyon, sample count, at aggregation ay maaaring lahat magbago ng naiulat na halaga. Ang isang shared metric name ay hindi sapat.
Ihiwalay ang set-level at single-output evidence
Inilalarawan ng FID ang mga distribusyon ng image-set. Ang SSIM at LPIPS ay nangangailangan ng makabuluhang reference para sa paghahambing. Ang isang human scorecard ay nagtatala ng nakikitang obserbasyon tungkol sa isang nirebyung output.
Huwag i-collapse ang bawat quality dimension
Ang identity, target-attribute preservation, boundaries, occlusion, technical integrity, at temporal stability ay maaaring mag-isa na mabigo at dapat manatiling masusuri.
Mga tanong sa glossary
Paano gamitin ang mga depinisyon na ito
Ibinubunyag ba ng pahinang ito ang eksaktong DeepSwapAI model stack?
Hindi. Tinutukoy nito ang mga konsepto sa industriya at pananaliksik nang hindi inaangkin na ang bawat binanggit na pamamaraan ay bahagi ng production implementation.
Maaari ko bang ikumpara ang parehong sukatan sa dalawang papel?
Pagkatapos lamang suriin na ang mga dataset, evaluator, preprocessing, implementasyon, at aggregation rules ay magkatugma.
Maaari bang sukatin ng FID ang isang output?
Hindi. Ang FID ay isang distribution-level measure at nangangailangan ng generated at reference image sets.
Pinatutunayan ba ng Content Credentials na ang isang imahe ay totoo?
Hindi. Nagbibigay sila ng provenance information at validation signals, hindi isang factual truth judgment.
Ilapat ang mga termino sa isang nakikitang output
Gamitin ang libreng scorecard upang suriin ang identity, boundaries, pose, lighting, occlusion, technical integrity, at video stability nang hindi ginagawang provider-wide claim ang isang sample.