Réponse directe
Un échange de visage par IA transfère les indices d'identité tout en préservant une scène cible
Dans la formulation de recherche courante, la source fournit les informations d'identité et la cible fournit la pose, l'expression, le regard, les cheveux, le corps, les vêtements, le contexte d'éclairage, le cadrage et l'arrière-plan. Un système localise et normalise d'abord le visage, représente l'identité source et les attributs cibles, synthétise une région faciale de remplacement, puis affine et compose cette région dans la cible. Les systèmes vidéo doivent également maintenir le résultat stable dans le temps.
Cette distinction est importante. RetinaFace est une preuve utile de ce que la localisation faciale et les points de repère peuvent fournir ; ArcFace est une preuve utile pour la représentation d'identité ; FaceShifter, BlendFace, DiffSwap et VividFace montrent différentes approches de recherche pour le transfert d'identité, la préservation des attributs, l'occlusion et la cohérence temporelle. Leur inclusion ici ne signifie pas qu'ils sont des composants d'un seul système. Pour les files d'attente d'application, le règlement, la livraison et la rétention plutôt que les concepts de modèle, utilisez le guide séparé d'architecture du pipeline de production.
Source versus cible
L'identité et la scène ont des rôles différents
| Élément | Vient généralement de | Ce que le système essaie de faire | Conflit courant |
|---|---|---|---|
| Indices d'identité faciale | Portrait source | Transporter l'identité source reconnaissable dans le résultat | Flou, petit visage, points de repère faibles ou fuite d'identité de la cible |
| Pose et expression | Média cible | Conserver la direction de la tête, le regard, l'état de la bouche et l'expression | Grand décalage de pose ou une source qui cache les caractéristiques nécessaires |
| Cheveux, oreilles, corps et vêtements | Média cible | Laisser le contenu de la scène non faciale intact | Les masques coupent à travers les cheveux, les lunettes, les mains ou les accessoires |
| Contexte d'éclairage et de couleur | Média cible | Faire en sorte que la région insérée appartienne à la même scène | Exposition, balance des blancs, ombres ou compression différents |
| Arrière-plan et cadrage | Média cible | Préserver la composition originale | Recadrage, bord ou normalisation géométrique instables |
Il s'agit d'une division conceptuelle, pas d'une garantie que chaque pixel la suit parfaitement. Le guide de préparation de deux photos applique les mêmes rôles à l'espace de travail actuel, tandis que le glossaire technique définit le transfert d'identité et la préservation des attributs cibles avec des limites de source.
Pipeline conceptuel en sept étapes
De la localisation du visage à un résultat examiné
- Détecter et localiser le visage cible. Un détecteur estime une boîte faciale et des points de repère. RetinaFace démontre une conception de recherche qui prédit conjointement les boîtes faciales, les points de repère 2D et les sommets faciaux 3D, illustrant pourquoi la localisation peut fournir plus qu'un recadrage rectangulaire.
- Aligner et normaliser le recadrage du visage. Les transformations guidées par les points de repère mettent le visage dans une échelle et une orientation plus stables. Le pipeline VFX haute résolution de Nirkin et ses collègues décrit explicitement la détection, la normalisation basée sur les points de repère, la normalisation inverse et le mélange.
- Représenter l'identité source. Les encodeurs d'identité mappent un visage source en caractéristiques destinées à distinguer une identité d'une autre. ArcFace est un exemple principal d'embeddings discriminants de reconnaissance faciale ; BlendFace montre pourquoi un encodeur d'identité peut également porter des attributs indésirables et encadre le désenchevêtrement comme un problème d'échange de visage.
- Conditionner sur les attributs cibles. La cible fournit la pose, l'expression, le regard, le contexte d'éclairage et la scène. FaceShifter décrit l'intégration de l'identité dans les attributs cibles, tandis que ses résultats et ablations séparent la récupération d'identité de la gestion des attributs et de l'occlusion.
- Synthétiser le visage de remplacement. La transformation peut être construite avec un guidage 3D, un générateur antagoniste, une diffusion ou un hybride. DiffSwap, par exemple, utilise une diffusion masquée consciente de la 3D ; c'est une famille publiée, pas une recette universelle.
- Masquer, affiner et composer. La région faciale générée doit revenir aux coordonnées cibles et rencontrer les pixels originaux à des limites crédibles. Les occlusions, les cheveux, les lunettes, le teint, le contraste et l'éclairage peuvent nécessiter des masques et un affinage plutôt qu'un simple collage rectangulaire.
- Stabiliser et examiner la vidéo dans le temps. La vidéo ajoute une correspondance entre les images. Le lissage des points de repère, la génération temporellement consciente et les masques cohérents peuvent réduire les à-coups, mais l'examen a toujours besoin de tours, de parole, de clignements, de flou de mouvement, d'occlusion et d'images de récupération.
Familles d'architectures
Les méthodes 3D, antagonistes, de diffusion et hybrides résolvent différents sous-problèmes
| Famille | Capacité utile | Compromis de conception | Exemple principal |
|---|---|---|---|
| Guidé par la 3D | Géométrie faciale explicite, pose et correspondances | Les estimations géométriques peuvent être incomplètes autour des cheveux, de l'intérieur de la bouche, des occlusions et des vues extrêmes | High-Resolution Neural Face Swapping |
| Adversarial / basé sur les GAN | Synthèse directe et intégration des attributs d'identité | Les objectifs d'entraînement doivent équilibrer l'identité, les attributs, le réalisme et les limites | FaceShifter |
| Basé sur la diffusion | Génération conditionnelle itérative et contrôle masqué | La conception de l'échantillonnage, le conditionnement, le calcul, le contrôle de l'identité et la stabilité temporelle restent des décisions distinctes | DiffSwap |
| Vidéo hybride | Combine les détails d'identité de l'image avec la cohérence vidéo | Doit encore gérer l'occlusion, le mouvement, les variations de pose et la dérive d'image à image | VividFace |
Difficulté de l'entrée et de la scène
La plupart des échecs visibles peuvent être attribués à des preuves manquantes ou contradictoires
Visages petits ou flous
Peu de pixels utilisables affaiblissent les repères, les détails d'identité, la texture de la peau et les limites. L'upscaling ne peut pas recréer les preuves d'identité qui n'ont jamais été capturées.
Grand décalage de pose
Une référence frontale fournit des preuves limitées pour une cible de profil, et les régions faciales cachées doivent être déduites. Associez la référence à l'angle cible le plus important lorsque cela est possible.
Occlusion et accessoires
Les mains, les cheveux, les lunettes, les microphones, les masques et les ombres traversent la limite faciale. Un système doit décider quels pixels cibles restent devant et quels pixels générés se trouvent derrière eux.
Conflit d'éclairage et de couleur
Une exposition, une direction de la lumière, une balance des blancs, un contraste et une compression différents peuvent exposer la limite même lorsque le transfert d'identité est reconnaissable.
Expression et intérieur de la bouche
La parole, les dents, la langue et l'expression extrême combinent la géométrie avec une texture fine. Une correspondance d'identité peut encore sembler erronée si l'expression cible n'est pas préservée.
Compression répétée
Les médias à faible débit peuvent effacer les détails et introduire des blocs ou des sonneries. FaceForensics++ montre également que la compression modifie les conditions de détection de la manipulation, donc l'examen de la génération et l'interprétation du détecteur nécessitent le support encodé réel.
Utilisez le vérificateur d'entrée local pour les dimensions mesurables, la luminance, le contraste, l'écrêtage et les détails de contour. Ces mesures décrivent uniquement les entrées ; elles ne prédisent pas la similarité d'identité, le réalisme, le succès ou la qualité de la sortie finale.
Cohérence vidéo
Un échange de visage vidéo doit être cohérent entre les images, pas seulement attrayant dans les plans fixes
Le traitement d'image indépendant peut amplifier de minuscules changements dans la détection, les repères, les masques, la couleur ou les caractéristiques d'identité en un scintillement visible. Le pipeline VFX décrit la stabilisation des repères avant le rendu, tandis que VividFace traite la cohérence temporelle, les occlusions et les variations de pose comme des défis vidéo explicites. Ce sont des approches publiées, pas une description de l'implémentation privée de DeepSwapAI.
| Point d'examen | Quoi inspecter | Pourquoi un seul plan fixe est insuffisant |
|---|---|---|
| Stabilité des repères | Yeux, nez, bouche et mâchoire restent ancrés | De petits changements d'alignement apparaissent comme des secousses |
| Continuité de l'identité | Les indices reconnaissables ne dérivent pas pendant les virages ou la parole | Chaque image peut être plausible mais incohérente avec les images adjacentes |
| Continuité des limites | La racine des cheveux, les joues, la mâchoire et les oreilles ne palpitent pas | La forme et la couleur du masque peuvent changer avec le temps |
| Récupération d'occlusion | Le visage revient proprement après le passage d'une main, de cheveux ou d'un objet | L'artefact le plus difficile apparaît souvent après que l'occluseur se soit éloigné |
| Comportement de compression | Blocs de mouvement, sonneries et perte de détails après l'exportation | L'encodage final peut révéler des artefacts absents des images d'aperçu |
Le guide de préparation vidéo transforme ces concepts en un workflow de repérage de clips.
Carte d'évaluation
Demandez quelle relation chaque mesure évalue
| Question | Comparer avec | Type de preuve | Boundary |
|---|---|---|---|
| La sortie ressemble-t-elle à l'identité source ? | Identité source | Intégration d'identité ou examen d'identité humaine | Dépend du reconnaisseur, du recadrage, des données, du seuil et du protocole |
| Préserve-t-il la pose et l'expression cibles ? | Média cible | Repères, estimations de pose ou d'expression, et examen visuel | Une correspondance cible n'est pas un score d'identité |
| Le résultat et les limites sont-ils visuellement cohérents ? | Contexte de la sortie et de la cible | Mesures perceptuelles et examen humain structuré | Un score agrégé peut cacher un défaut local critique |
| Une distribution définie est-elle réaliste ? | Ensembles générés et de référence | Métriques au niveau de l'ensemble telles que FID | Le FID ne peut pas noter de manière défendable une seule image |
| La vidéo est-elle stable ? | Images et mouvement dans le temps | Métriques temporelles plus examen horodaté | Une bonne image clé n'établit pas la cohérence temporelle |
Pour les prérequis et l'interprétation exacts des métriques, utilisez la carte des métriques d'évaluationversionnée. Pour documenter une sortie visible sans en faire une affirmation à l'échelle du fournisseur, utilisez la fiche d'évaluation de l'examen humain.
Détection, provenance et divulgation
Trois questions différentes nécessitent trois outils différents
Détection
Un détecteur estime si un média contient des signaux de manipulation dans ses conditions d'entraînement et de test. La compression, les méthodes inédites et le changement de domaine peuvent modifier les performances ; un score n'est pas une preuve historique.
Provenance
Les Content Credentials C2PA peuvent transporter des assertions cryptographiquement vérifiables et des informations de validation sur la provenance d'un actif. La spécification ne décide explicitement pas si le contenu est factuellement vrai.
Divulgation et autorisation
Un créateur a toujours besoin d'autorisation, de contexte et d'une décision de divulgation honnête. Ni un détecteur ni un justificatif ne déterminent le consentement ou si une utilisation est légale, équitable ou trompeuse.
FaceForensics++ fournit des preuves de référence principales pour la détection de manipulation et les conditions de compression. La spécification C2PA 2.4 est la source principale pour les assertions de provenance et la validation. Lisez le planificateur de consentement et de divulgation pour la décision humaine que les signaux techniques ne peuvent pas remplacer.
Utilisation responsable
La capacité technique n'établit pas l'autorisation
Utilisez l'échange de visage uniquement avec les droits et l'autorisation nécessaires. Ne l'utilisez pas pour l'usurpation d'identité, la fraude, le harcèlement, le contenu sexuel impliquant une personne sans autorisation, le contenu impliquant des mineurs, les réclamations politiques ou commerciales trompeuses, les documents d'identité, les contrôles d'accès ou toute autre activité interdite. Conservez les fichiers originaux, enregistrez l'utilisation prévue et la base de consentement, examinez l'exportation exacte et divulguez les modifications matérielles lorsque le contexte pourrait induire le public en erreur.
Sources et méthode
Les articles principaux expliquent chaque concept ; ils ne décrivent pas une pile cachée
L'équipe produit DeepSwapAI a examiné les articles principaux ci-dessous et la spécification C2PA 2.4 le 28 juillet 2026. Nous avons utilisé chaque source uniquement pour le concept qu'elle soutient directement et avons gardé les exemples de recherche séparés des affirmations actuelles sur le produit. Voir le méthodologie de vérification des affirmations pour la limite éditoriale.
- RetinaFace, CVPR 2020 - boîtes faciales, repères et localisation.
- ArcFace, CVPR 2019 - représentation d'identité discriminante.
- FaceShifter, CVPR 2020 - intégration d'identité, attributs cibles et raffinement d'occlusion.
- High-Resolution Neural Face Swapping, 2020 - alignement, normalisation inverse, composition et stabilisation vidéo.
- BlendFace, ICCV 2023 - fuite d'attributs et désintrication du codeur d'identité.
- DiffSwap, CVPR 2023 - diffusion masquée consciente de la 3D.
- VividFace, NeurIPS 2025 - cohérence vidéo, variation de pose et défis d'occlusion.
- FaceForensics++, ICCV 2019 - référence de détection de manipulation et conditions de compression.
- C2PA Technical Specification 2.4 - assertions de provenance et validation, avec une limite de vérité explicite.
Questions techniques
Réponses courtes avec limites de preuve
Que change un échange de visage par IA ?
Il vise à transférer les indices d'identité source tout en préservant la pose cible, l'expression, les cheveux, le corps, les vêtements, le contexte d'éclairage, le cadrage et l'arrière-plan. La limite exacte dépend de la méthode et des entrées.
Cela révèle-t-il le modèle DeepSwapAI ?
Non. La recherche publique explique les concepts ; ce n'est pas une preuve qu'un composant cité est utilisé en production.
Pourquoi un décalage de pose est-il problématique ?
Les régions cachées ou orientées différemment ont des preuves correspondantes plus faibles, donc le système doit déduire plus de contenu.
Pourquoi une bonne image peut-elle encore faire une mauvaise vidéo ?
L'identité, les repères, les masques, la couleur et les limites peuvent dériver entre des images par ailleurs plausibles.
Une seule métrique peut-elle prouver la qualité ?
Non. L'identité, la préservation de la cible, les limites, la qualité perceptuelle et la stabilité temporelle sont des questions distinctes.
Les détecteurs ou les Content Credentials prouvent-ils la vérité ?
Non. La détection estime les signaux de manipulation selon un protocole ; la provenance enregistre les assertions et les informations de validation. Ni l'un ni l'autre ne déterminent la vérité factuelle ou l'autorisation.