Penjelasan teknis berbasis penelitian

Cara kerja pertukaran wajah AI, langkah demi langkah

Penukaran wajah AI memperkirakan di mana wajah berada, memisahkan isyarat identitas dari pemandangan target, mensintesis pengganti, dan mengintegrasikannya kembali ke dalam gambar atau video. Panduan ini menjelaskan alur konseptual tersebut, mengapa masukan gagal, dan cara mengevaluasi keluaran tanpa berpura-pura satu metrik membuktikan kualitas.

Oleh Tim Produk DeepSwapAISumber utama ditinjau pada 28 Juli 2026Penjelasan teknis yang dikutip dari sumber

Pertukaran wajah AI mentransfer isyarat identitas sambil mempertahankan adegan target

Dalam formulasi penelitian umum, sumber menyediakan informasi identitas dan target menyediakan pose, ekspresi, tatapan, rambut, tubuh, pakaian, konteks pencahayaan, pembingkaian, dan latar belakang. Sebuah sistem pertama-tama melokalisasi dan menormalkan wajah, merepresentasikan identitas sumber dan atribut target, mensintesis area wajah pengganti, kemudian menyempurnakan dan menggabungkan area tersebut ke dalam target. Sistem video juga harus menjaga hasil tetap stabil sepanjang waktu.

Peta penelitian, bukan klaim model privat: halaman ini menjelaskan konsep yang didokumentasikan dalam makalah utama dan spesifikasi C2PA saat ini. Halaman ini tidak mengungkapkan atau mengklaim detektor, encoder, generator, set pelatihan, kerugian, penyedia, atau model mana yang digunakan DeepSwapAI dalam produksi.

Perbedaan itu penting. RetinaFace adalah bukti berguna untuk apa yang dapat disediakan oleh lokalisasi wajah dan landmark; ArcFace adalah bukti berguna untuk representasi identitas; FaceShifter, BlendFace, DiffSwap, dan VividFace menunjukkan pendekatan penelitian yang berbeda untuk transfer identitas, pelestarian atribut, okulasi, dan konsistensi temporal. Penyertaan mereka di sini tidak berarti mereka adalah komponen dari satu sistem. Untuk antrean aplikasi, penyelesaian, pengiriman, dan retensi daripada konsep model, gunakan panduan arsitektur jalur produksi yang terpisah.

Identitas dan latar memiliki peran yang berbeda

ElemenBiasanya berasal dariApa yang coba dilakukan sistemKonflik Umum
Isyarat Identitas WajahPotret SumberMembawa identitas sumber yang dapat dikenali ke dalam hasilKabur, wajah kecil, landmark lemah, atau kebocoran identitas dari target
Pose dan EkspresiMedia targetMenjaga arah kepala, arah pandangan, keadaan mulut, dan ekspresiKetidakcocokan pose besar atau sumber yang menyembunyikan fitur yang diperlukan
Rambut, Telinga, Tubuh, dan PakaianMedia targetMembiarkan konten non-wajah dalam pemandangan tetap utuhTopeng memotong rambut, kacamata, tangan, atau aksesori
Konteks Pencahayaan dan WarnaMedia targetMembuat area yang disisipkan menjadi bagian dari pemandangan yang samaEksposur, keseimbangan putih, bayangan, atau kompresi yang berbeda
Latar Belakang dan PembingkaianMedia targetMempertahankan komposisi asliPemotongan, batas, atau normalisasi geometris yang tidak stabil

Ini adalah pembagian konseptual, bukan jaminan bahwa setiap piksel mengikutinya dengan sempurna. Panduan Persiapan Dua Foto menerapkan peran yang sama ke ruang kerja saat ini, sementara glosarium teknis mendefinisikan transfer identitas dan pelestarian atribut target dengan batasan sumber.

Dari lokalisasi wajah hingga hasil yang ditinjau

  1. Mendeteksi dan melokalisasi wajah target. Detektor memperkirakan kotak wajah dan landmark. RetinaFace mendemonstrasikan desain riset yang bersama-sama memprediksi kotak wajah, landmark 2D, dan simpul wajah 3D, menggambarkan mengapa lokalisasi dapat memberikan lebih dari sekadar potongan persegi panjang.
  2. Menyelaraskan dan menormalkan potongan wajah. Transformasi yang dipandu landmark menempatkan wajah ke dalam skala dan orientasi yang lebih stabil. Pipa VFX resolusi tinggi oleh Nirkin dan koleganya secara eksplisit menjelaskan deteksi, normalisasi berbasis landmark, normalisasi balik, dan pencampuran.
  3. Mewakili identitas sumber. Penyandi identitas memetakan wajah sumber menjadi fitur yang dimaksudkan untuk membedakan satu identitas dari yang lain. ArcFace adalah contoh utama dari penyematan pengenalan wajah diskriminatif; BlendFace menunjukkan mengapa penyandi identitas juga dapat membawa atribut yang tidak diinginkan dan membingkai pemisahan sebagai masalah pertukaran wajah.
  4. Mengkondisikan atribut target. Target menyediakan pose, ekspresi, arah pandangan, konteks pencahayaan, dan pemandangan. FaceShifter menjelaskan integrasi identitas ke dalam atribut target, sementara hasil dan ablasi-nya memisahkan pengambilan identitas dari penanganan atribut dan okulasi.
  5. Mensintesis wajah pengganti. Transformasi dapat dibangun dengan panduan 3D, generator adversarial, difusi, atau hibrida. DiffSwap, misalnya, menggunakan difusi bertopeng yang sadar 3D; itu adalah satu keluarga yang dipublikasikan, bukan resep universal.
  6. Topeng, perbaiki, dan komposit. Wilayah wajah yang dihasilkan harus kembali ke koordinat target dan bertemu dengan piksel asli pada batas yang meyakinkan. Okulasi, rambut, kacamata, warna kulit, kontras, dan pencahayaan dapat memerlukan topeng dan perbaikan daripada sekadar tempel persegi panjang sederhana.
  7. Stabilkan dan tinjau video dari waktu ke waktu. Video menambahkan korespondensi antar bingkai. Penghalusan landmark, pembuatan yang sadar temporal, dan topeng yang konsisten dapat mengurangi kegoyahan, tetapi tinjauan masih memerlukan belokan, ucapan, kedipan, keburaman gerak, okulasi, dan bingkai pemulihan.

Metode 3D, adversarial, difusi, dan hibrida memecahkan sub-masalah yang berbeda

KeluargaKemampuan BergunaTukar rugi desainContoh Utama
Panduan 3DGeometri wajah eksplisit, pose, dan korespondensiEstimasi geometri bisa tidak lengkap di sekitar rambut, bagian dalam mulut, okulasi, dan tampilan ekstremHigh-Resolution Neural Face Swapping
Adversarial / Berbasis GANSintesis langsung dan integrasi identitas-atributTujuan pelatihan harus menyeimbangkan identitas, atribut, realisme, dan batasFaceShifter
Berbasis DifusiGenerasi bersyarat iteratif dan kontrol bertopengDesain pengambilan sampel, pengkondisian, komputasi, kontrol identitas, dan stabilitas temporal tetap menjadi keputusan terpisahDiffSwap
Video HibridaMenggabungkan detail identitas gambar dengan konsistensi sadar videoMasih harus menangani okulasi, gerakan, variasi pose, dan penyimpangan antar bingkaiVividFace
Jangan jadikan keluarga sebagai papan peringkat. Hasil makalah tergantung pada kumpulan data, implementasi, potongan, evaluator, kompresi, jumlah sampel, dan protokolnya. Label arsitektur saja tidak menetapkan kualitas, kecepatan, biaya, keamanan, atau kesesuaian produksi.

Sebagian besar kegagalan yang terlihat dapat dilacak pada bukti yang hilang atau bukti yang bertentangan

Wajah Kecil atau Kabur

Beberapa piksel yang dapat digunakan melemahkan landmark, detail identitas, tekstur kulit, dan batas. Upscaling tidak dapat menciptakan kembali bukti identitas yang tidak pernah ditangkap.

Ketidakcocokan Pose Besar

Referensi frontal memberikan bukti terbatas untuk target dalam profil, dan wilayah wajah yang tersembunyi harus disimpulkan. Cocokkan referensi dengan sudut target yang paling penting bila memungkinkan.

Okulasi dan Aksesori

Tangan, rambut, kacamata, mikrofon, topeng, dan bayangan melintasi batas wajah. Sebuah sistem harus memutuskan piksel target mana yang tetap di depan dan piksel yang dihasilkan mana yang berada di belakangnya.

Konflik Pencahayaan dan Warna

Eksposur, arah cahaya, keseimbangan putih, kontras, dan kompresi yang berbeda dapat mengekspos batas bahkan ketika transfer identitas dapat dikenali.

Ekspresi dan Bagian Dalam Mulut

Ucapan, gigi, lidah, dan ekspresi ekstrem menggabungkan geometri dengan tekstur halus. Kecocokan identitas masih bisa terlihat salah jika ekspresi target tidak dipertahankan.

Kompresi Berulang

Media bitrate rendah dapat menghilangkan detail dan menimbulkan blok atau dering. FaceForensics++ juga menunjukkan bahwa kompresi mengubah kondisi deteksi manipulasi, sehingga baik tinjauan pembuatan maupun interpretasi detektor memerlukan media yang sebenarnya telah dikodekan.

Gunakan pemeriksa masukan lokal untuk dimensi yang dapat diukur, pencahayaan, kontras, pemotongan, dan detail tepi. Pengukuran tersebut hanya menjelaskan masukan; mereka tidak memprediksi kesamaan identitas, realisme, keberhasilan, atau kualitas keluaran akhir.

Pertukaran wajah video harus koheren antar bingkai, tidak hanya menarik dalam gambar diam

Pemrosesan bingkai independen dapat memperkuat perubahan kecil dalam deteksi, landmark, topeng, warna, atau fitur identitas menjadi kedipan yang terlihat. Pipa VFX menjelaskan stabilisasi landmark sebelum rendering, sementara VividFace memperlakukan konsistensi temporal, okulasi, dan variasi pose sebagai tantangan video eksplisit. Ini adalah pendekatan yang dipublikasikan, bukan deskripsi implementasi pribadi DeepSwapAI.

Titik TinjauApa yang harus diperiksaMengapa satu gambar diam tidak mencukupi
Stabilitas LandmarkMata, hidung, mulut, dan rahang tetap tertambatPerubahan penyelarasan kecil muncul sebagai goyangan
Kontinuitas IdentitasIsyarat yang dapat dikenali tidak menyimpang selama belokan atau ucapanSetiap bingkai bisa masuk akal tetapi tidak konsisten dengan bingkai yang berdekatan
Kontinuitas BatasGaris rambut, pipi, rahang, dan telinga tidak berdenyutBentuk dan warna topeng dapat berubah seiring waktu
Pemulihan okulasiWajah kembali bersih setelah tangan, rambut, atau benda lewatArtefak paling sulit sering muncul setelah penghalang menjauh
Perilaku KompresiBlok gerak, dering, dan kehilangan detail setelah eksporPengkodean akhir dapat mengungkapkan artefak yang tidak ada dari bingkai pratinjau

Panduan panduan persiapan video mengubah konsep-konsep ini menjadi alur kerja pencarian klip.

Tanyakan hubungan mana yang diukur oleh setiap evaluasi

PertanyaanBandingkan denganJenis BuktiBatas
Apakah keluaran menyerupai identitas sumber?Identitas SumberPenyematan identitas atau tinjauan identitas manusiaTergantung pada pengenal, potongan, data, ambang batas, dan protokol
Apakah itu mempertahankan pose dan ekspresi target?Media targetLandmark, estimasi pose atau ekspresi, dan tinjauan visualKecocokan target bukanlah skor identitas
Apakah hasil dan batasnya koheren secara visual?Keluaran dan konteks targetUkuran perseptual dan tinjauan manusia terstrukturSatu skor agregat dapat menyembunyikan cacat lokal yang kritis
Apakah distribusi yang ditetapkan realistis?Kumpulan yang dihasilkan dan referensiMetrik tingkat set seperti FIDFID tidak dapat menilai satu gambar secara defensif
Apakah video stabil?Bingkai dan gerakan dari waktu ke waktuMetrik temporal plus tinjauan stempel waktuBingkai kunci yang baik tidak menetapkan konsistensi temporal

Untuk prasyarat dan interpretasi metrik yang tepat, gunakan peta metrik evaluasiyang memiliki versi. Untuk mendokumentasikan satu keluaran yang terlihat tanpa mengubahnya menjadi klaim di seluruh penyedia, gunakan kartu skor tinjauan manusia.

Tiga pertanyaan berbeda memerlukan tiga alat berbeda

01

Deteksi

Detektor memperkirakan apakah media berisi sinyal manipulasi di bawah kondisi pelatihan dan pengujiannya. Kompresi, metode yang tidak terlihat, dan pergeseran domain dapat mengubah kinerja; skor bukanlah bukti historis.

02

Asal-usul

C2PA Content Credentials dapat membawa pernyataan yang dapat diverifikasi secara kriptografis dan informasi validasi tentang provenans aset. Spesifikasi secara eksplisit tidak memutuskan apakah konten itu benar secara faktual.

03

Pengungkapan dan Izin

Seorang kreator masih memerlukan izin, konteks, dan keputusan pengungkapan yang jujur. Baik detektor maupun kredensial tidak menentukan persetujuan atau apakah penggunaan itu sah, adil, atau menyesatkan.

FaceForensics++ menyediakan bukti tolok ukur utama untuk deteksi manipulasi dan kondisi kompresi. Spesifikasi C2PA 2.4 adalah sumber utama untuk pernyataan provenans dan validasi. Baca perencana persetujuan dan pengungkapan untuk keputusan manusia yang tidak dapat digantikan oleh sinyal teknis.

Kemampuan teknis tidak menetapkan izin

Gunakan pertukaran wajah hanya dengan hak dan izin yang diperlukan. Jangan menggunakannya untuk peniruan identitas, penipuan, pelecehan, konten seksual yang melibatkan seseorang tanpa izin, konten yang melibatkan anak di bawah umur, klaim politik atau komersial yang menipu, dokumen identitas, kontrol akses, atau aktivitas terlarang lainnya. Simpan file asli, catat tujuan penggunaan dan dasar persetujuan, tinjau ekspor yang tepat, dan ungkapkan suntingan material ketika konteks dapat menyesatkan audiens.

Batas Produk: penjelasan ini tidak menjanjikan bahwa masukan tertentu akan diterima, selesai, akurat, realistis, stabil secara temporal, atau cocok untuk penggunaan tertentu. Aturan layanan saat ini ada di Ketentuan dan fakta produk saat ini ada di Pusat Kepercayaan.

Makalah utama menjelaskan setiap konsep; mereka tidak menggambarkan satu tumpukan tersembunyi

Tim Produk DeepSwapAI meninjau makalah utama di bawah ini dan spesifikasi C2PA 2.4 pada 28 Juli 2026. Kami menggunakan setiap sumber hanya untuk konsep yang didukungnya secara langsung dan menjaga contoh riset tetap terpisah dari klaim produk saat ini. Lihat metodologi verifikasi klaim untuk batas editorial.

Jawaban singkat dengan batasan bukti

Apa yang diubah oleh pertukaran wajah AI?

Ini bertujuan untuk mentransfer isyarat identitas sumber sambil mempertahankan pose target, ekspresi, rambut, tubuh, pakaian, konteks pencahayaan, pembingkaian, dan latar belakang. Batas yang tepat tergantung pada metode dan input.

Apakah ini mengungkapkan model DeepSwapAI?

Tidak. Riset publik menjelaskan konsep; ini bukan bukti bahwa komponen yang dikutip digunakan dalam produksi.

Mengapa ketidakcocokan pose merugikan?

Area yang tersembunyi atau berorientasi berbeda memiliki bukti terkait yang lebih lemah, sehingga sistem harus menyimpulkan lebih banyak konten.

Mengapa satu bingkai yang bagus masih bisa menghasilkan video yang buruk?

Identitas, penanda, topeng, warna, dan batas dapat bergeser di antara bingkai yang tampaknya masuk akal.

Bisakah satu metrik membuktikan kualitas?

Tidak. Identitas, pelestarian target, batas, kualitas persepsi, dan stabilitas temporal adalah pertanyaan yang terpisah.

Apakah detektor atau Kredensial Konten membuktikan kebenaran?

Tidak. Deteksi memperkirakan sinyal manipulasi di bawah protokol; catatan asal-usul menyatakan informasi asersi dan validasi. Tidak satu pun yang menentukan kebenaran faktual atau izin.

Siapkan input dengan bukti yang terukur

Periksa dimensi sumber dan target, luminansi, kontras, pemotongan, dan detail tepi secara lokal sebelum membuka ruang kerja penukaran wajah.

Buka pemeriksa input lokal