Direkt svar
Ett AI-ansiktsbyte överför identitetsledtrådar samtidigt som en målscen bevaras
I den vanliga forskningsformuleringen levererar källan identitetsinformation och målet tillhandahåller posen, uttrycket, blicken, håret, kroppen, kläderna, ljussättningskontexten, inramningen och bakgrunden. Ett system lokaliserar och normaliserar först ansiktet, representerar källidentitet och målegenskaper, syntetiserar en ersättande ansiktsregion, förfinar och kompositerar sedan den regionen in i målet. Videosystem måste också hålla resultatet stabilt över tid.
Den distinktionen är viktig. RetinaFace är användbart bevis för vad ansiktslokalisering och landmärken kan tillhandahålla; ArcFace är användbart bevis för identitetsrepresentation; FaceShifter, BlendFace, DiffSwap och VividFace visar olika forskningsmetoder för identitetsöverföring, attributbevarande, ocklusion och temporal konsistens. Deras inkludering här betyder inte att de är komponenter i ett system. För applikationsköer, avräkning, leverans och lagring snarare än modellkoncept, använd den separata produktionspipeline-arkitekturguiden.
Källa kontra mål
Identitet och scen har olika uppgifter
| Element | Kommer vanligtvis från | Vad systemet försöker göra | Vanlig konflikt |
|---|---|---|---|
| Ansiktsidentitetsledtrådar | Källporträtt | Bär igenkännbar källidentitet in i resultatet | Oskärpa, litet ansikte, svaga landmärken eller identitetsläckage från målet |
| Pos och uttryck | Målmedia | Behåll huvudriktning, blick, munstatus och uttryck | Stor posemismatch eller en källa som döljer nödvändiga egenskaper |
| Hår, öron, kropp och kläder | Målmedia | Lämna icke-ansiktsinnehåll i scenen intakt | Masker skär över hår, glasögon, händer eller tillbehör |
| Ljussättnings- och färgkontext | Målmedia | Få den insatta regionen att tillhöra samma scen | Olika exponering, vitbalans, skuggor eller komprimering |
| Bakgrund och inramning | Målmedia | Bevara den ursprungliga kompositionen | Instabil beskärning, kant eller geometrisk normalisering |
Detta är en konceptuell uppdelning, inte en garanti för att varje pixel följer den perfekt. två-foto-förberedelseguiden tillämpar samma roller på den aktuella arbetsytan, medan den tekniska ordlistan definierar identitetsöverföring och målattributbevarande med källgränser.
Sjustegs konceptuell pipeline
Från ansiktslokalisering till ett granskat resultat
- Detektera och lokalisera målansiktet. En detektor uppskattar en ansiktsruta och landmärken. RetinaFace demonstrerar en forskningsdesign som gemensamt förutsäger ansiktsrutor, 2D-landmärken och 3D-ansiktsvertices, vilket illustrerar varför lokalisering kan ge mer än en rektangulär beskärning.
- Rikta in och normalisera ansiktsbeskärningen. Landmärkesstyrda transformationer sätter ansiktet i en mer stabil skala och orientering. Den högupplösta VFX-pipelinen av Nirkin och kollegor beskriver explicit detektion, landmärkesbaserad normalisering, omvänd normalisering och blandning.
- Representera källidentiteten. Identitetskodare mappar ett källansikte till funktioner avsedda att särskilja en identitet från en annan. ArcFace är ett primärt exempel på diskriminativa ansiktsigenkänningsinbäddningar; BlendFace visar varför en identitetskodare också kan bära oönskade attribut och ramar in disintanglement som ett ansiktsbytesproblem.
- Villkora på målegenskaper. Målet tillhandahåller posen, uttrycket, blicken, ljussättningskontexten och scenen. FaceShifter beskriver identitetsintegration i målegenskaper, medan dess resultat och ablationer separerar identitetshämtning från attribut- och ocklusionshantering.
- Syntetisera ersättningsansiktet. Transformationen kan byggas med 3D-vägledning, en adversariell generator, diffusion eller en hybrid. DiffSwap, till exempel, använder 3D-medveten maskerad diffusion; det är en publicerad familj, inte ett universellt recept.
- Maskera, förfina och kompositera. Den genererade ansiktsregionen måste återgå till målkoordinater och möta de ursprungliga pixlarna vid trovärdiga gränser. Ocklusioner, hår, glasögon, hudton, kontrast och belysning kan kräva masker och förfining snarare än en enkel rektangulär inklistring.
- Stabilisera och granska video över tid. Video lägger till korrespondens mellan bildrutor. Landmärkesutjämning, tidsmedveten generering och konsekventa masker kan minska flimmer, men granskning behöver fortfarande vändningar, tal, blinkningar, rörelseoskärpa, ocklusion och återställningsbildrutor.
Arkitekturfamiljer
3D, adversariella, diffusions- och hybridmetoder löser olika delproblem
| Familj | Användbar förmåga | Designavvägning | Primärt exempel |
|---|---|---|---|
| 3D-vägledd | Explicit ansiktsgeometri, pos och korrespondenser | Geometriuppskattningar kan vara ofullständiga runt hår, muninteriörer, ocklusioner och extrema vyer | High-Resolution Neural Face Swapping |
| Adversariell / GAN-baserad | Direkt syntes och identitets-attributintegration | Träningsmål måste balansera identitet, attribut, realism och gränser | FaceShifter |
| Diffusionsbaserad | Iterativ villkorlig generering och maskerad kontroll | Samplingsdesign, villkor, beräkning, identitetskontroll och temporal stabilitet förblir separata beslut | DiffSwap |
| Hybrid video | Kombinerar bildidentitetsdetalj med videomedveten konsistens | Måste fortfarande hantera ocklusion, rörelse, posevariation och bildruta-till-bildruta-drift | VividFace |
Indata- och scenkomplexitet
De flesta synliga misslyckanden kan spåras till saknade eller motstridiga bevis
Små eller oskarpa ansikten
Få användbara pixlar försvagar landmärken, identitetsdetaljer, hudstruktur och gränser. Uppskalning kan inte återskapa identitetsbevis som aldrig fångats.
Stor posemismatch
En frontalreferens ger begränsade bevis för ett mål i profil, och dolda ansiktsregioner måste härledas. Matcha referensen till den viktigaste målvinkeln när det är möjligt.
Ocklusion och tillbehör
Händer, hår, glasögon, mikrofoner, masker och skuggor korsar ansiktsgränsen. Ett system måste bestämma vilka målpixlar som stannar framför och vilka genererade pixlar som hör bakom dem.
Ljussättnings- och färgkonflikt
Olika exponering, ljusriktning, vitbalans, kontrast och komprimering kan exponera gränsen även när identitetsöverföringen är igenkännbar.
Uttryck och muninteriörer
Tal, tänder, tunga och extrema uttryck kombinerar geometri med fin textur. En identitetsmatchning kan fortfarande se fel ut om måluttrycket inte bevaras.
Upprepad komprimering
Lågbitratemedier kan radera detaljer och introducera block eller ringning. FaceForensics++ visar också att komprimering ändrar manipulationsdetekteringsförhållanden, så både generationsgranskning och detektortolkning behöver de faktiskt kodade medierna.
Använd lokal indatakontroll för mätbara dimensioner, luminans, kontrast, klippning och kantdetaljer. Dessa mätningar beskriver endast indata; de förutsäger inte identitetslikhet, realism, framgång eller slutlig utdatakvalitet.
Videokonsistens
Ett videoansiktsbyte måste vara sammanhängande mellan bildrutor, inte bara attraktivt i stillbilder
Oberoende bildruteprocessning kan förstora små förändringar i detektion, landmärken, masker, färg eller identitetsfunktioner till synligt flimmer. VFX-pipelinen beskriver landmärkesstabilisering före rendering, medan VividFace behandlar temporal konsistens, ocklusioner och posevariation som explicita videoutmaningar. Dessa är publicerade metoder, inte en beskrivning av DeepSwapAI:s privata implementering.
| Granskningspunkt | Vad ska inspekteras | Varför en stillbild är otillräcklig |
|---|---|---|
| Landmärkesstabilitet | Ögon, näsa, mun och käke förblir förankrade | Små justeringsförändringar uppträder som skakning |
| Identitetskontinuitet | Igenkännbara ledtrådar driver inte under vändningar eller tal | Varje bildruta kan vara trovärdig men inkonsekvent med intilliggande bildrutor |
| Gränskontinuitet | Hårfäste, kinder, käke och öron pulserar inte | Maskform och färg kan förändras över tid |
| Ocklusionsåterhämtning | Ansiktet återvänder rent efter att en hand, hår eller ett föremål passerat | Det svåraste artefakten visas ofta efter att ockludören flyttat sig |
| Komprimeringsbeteende | Rörelseblock, ringning och detaljförlust efter export | Slutlig kodning kan avslöja artefakter som saknas i förhandsgranskningsbildrutor |
Den videoförberedelseguiden förvandlar dessa koncept till ett klipp-spaningsarbetsflöde.
Utvärderingskarta
Fråga vilket förhållande varje mätning utvärderar
| Fråga | Jämför mot | Bevisstyp | Gräns |
|---|---|---|---|
| Liknar utdatan källidentiteten? | Källidentitet | Identitetsinbäddning eller mänsklig identitetsgranskning | Beror på igenkännaren, beskärningen, datan, tröskelvärdet och protokollet |
| Bevarar den målpos och måluttryck? | Målmedia | Landmärken, pos- eller uttrycksuppskattningar och visuell granskning | En målmatchning är inte en identitetspoäng |
| Är resultatet och gränserna visuellt sammanhängande? | Utdatakontext och målkontext | Perceptuella mått och strukturerad mänsklig granskning | En aggregerad poäng kan dölja en kritisk lokal defekt |
| Är en uppsättningsdistribution realistisk? | Genererade och referensuppsättningar | Uppsättningsnivåmått som FID | FID kan inte försvarligt poängsätta en bild |
| Är videon stabil? | Bildrutor och rörelse över tid | Temporala mått plus tidsstämplad granskning | En bra nyckelbildruta etablerar inte temporal konsistens |
För exakta måttförutsättningar och tolkning, använd den versionerade utvärderingsmåttkartan. För att dokumentera en synlig utdata utan att förvandla den till ett leverantörsomfattande påstående, använd mänsklig-granskningsscorecard.
Detektion, ursprung och avslöjande
Tre olika frågor kräver tre olika verktyg
Detektion
En detektor uppskattar om media innehåller manipulationssignaler under dess tränings- och testförhållanden. Komprimering, oanvända metoder och domänförskjutning kan ändra prestanda; en poäng är inte historiskt bevis.
Proveniens
C2PA Content Credentials kan bära kryptografiskt verifierbara påståenden och valideringsinformation om en tillgångs ursprung. Specifikationen avgör uttryckligen inte om innehåll är faktamässigt sant.
Avslöjande och tillstånd
En skapare behöver fortfarande tillstånd, sammanhang och ett ärligt avslöjandebeslut. Varken en detektor eller en credential avgör samtycke eller om en användning är laglig, rättvis eller vilseledande.
FaceForensics++ tillhandahåller primära riktmärkesbevis för manipulationsdetektion och komprimeringsförhållanden. C2PA 2.4-specifikationen är den primära källan för härkomstpåståenden och validering. Läs samtyckes- och informationsplaneraren för det mänskliga beslutet som tekniska signaler inte kan ersätta.
Ansvarsfull användning
Teknisk förmåga etablerar inte tillstånd
Använd endast ansiktsbyte med nödvändiga rättigheter och tillstånd. Använd det inte för imitation, bedrägeri, trakasserier, sexuellt innehåll som involverar en person utan tillstånd, innehåll som involverar minderåriga, vilseledande politiska eller kommersiella påståenden, identitetsdokument, åtkomstkontroller eller annan förbjuden aktivitet. Bevara originalfiler, dokumentera den avsedda användningen och samtyckesgrunden, granska den exakta exporten och avslöja materiella redigeringar när sammanhanget kan vilseleda en publik.
Källor och metod
Primära artiklar förklarar varje koncept; de beskriver inte en dold stack
DeepSwapAI Produktteamet granskade de primära artiklarna nedan och C2PA-specifikation 2.4 den 28 juli 2026. Vi använde varje källa endast för det koncept den direkt stöder och höll forskningsexempel separata från aktuella produktpåståenden. Se metod för påståendeverifiering för den redaktionella gränsen.
- RetinaFace, CVPR 2020 - ansiktsboxar, landmärken och lokalisering.
- ArcFace, CVPR 2019 - diskriminativ identitetsrepresentation.
- FaceShifter, CVPR 2020 - identitetsintegration, målegenskaper och ocklusionsförfining.
- High-Resolution Neural Face Swapping, 2020 - justering, omvänd normalisering, kompositering och videostabilisering.
- BlendFace, ICCV 2023 - identitetskodarläckage och disintrangling.
- DiffSwap, CVPR 2023 - 3D-medveten maskerad diffusion.
- VividFace, NeurIPS 2025 - videokonsistens, posevariation och ocklusionsutmaningar.
- FaceForensics++, ICCV 2019 - manipulationsdetekteringsriktmärke och kompressionsförhållanden.
- C2PA Technical Specification 2.4 - härkomstpåståenden och validering, med en explicit sanningsgräns.
Tekniska frågor
Korta svar med bevisgränser
Vad ändrar ett AI-ansiktsbyte?
Den syftar till att överföra källidentitetsledtrådar samtidigt som målpose, uttryck, hår, kropp, kläder, ljussättningskontext, inramning och bakgrund bevaras. Den exakta gränsen beror på metoden och indata.
Avslöjar detta DeepSwapAI-modellen?
Nej. Offentlig forskning förklarar koncept; det är inte bevis för att en citerad komponent används i produktion.
Varför skadar pose-avvikelse?
Dolda eller annorlunda orienterade regioner har svagare motsvarande bevis, så systemet måste härleda mer innehåll.
Varför kan en bra bildruta fortfarande ge en dålig video?
Identitet, landmärken, masker, färg och gränser kan driva mellan annars rimliga bildrutor.
Kan ett mått bevisa kvalitet?
Nej. Identitet, målbevarande, gränser, perceptuell kvalitet och tidsmässig stabilitet är separata frågor.
Bevisar detektorer eller innehållslegitimation sanning?
Nej. Detektering uppskattar manipulationssignaler under ett protokoll; härkomst registrerar påståenden och valideringsinformation. Ingen av dem avgör faktisk sanning eller tillstånd.