Trình giải thích kỹ thuật dựa trên nghiên cứu

Cách hoán đổi khuôn mặt AI hoạt động, từng bước một

Hoán đổi khuôn mặt AI ước tính vị trí của khuôn mặt, tách các dấu hiệu danh tính khỏi cảnh mục tiêu, tổng hợp một khuôn mặt thay thế và tích hợp nó trở lại vào hình ảnh hoặc video. Hướng dẫn này giải thích quy trình khái niệm đó, tại sao đầu vào thất bại và cách đánh giá đầu ra mà không giả vờ rằng một số liệu duy nhất chứng minh chất lượng.

Bởi Nhóm sản phẩm DeepSwapAINguồn chính được xem xét ngày 28 tháng 7 năm 2026Bài giải thích kỹ thuật có trích dẫn nguồn

Hoán đổi khuôn mặt AI chuyển các dấu hiệu nhận dạng trong khi vẫn giữ nguyên cảnh mục tiêu

Trong công thức nghiên cứu phổ biến, nguồn cung cấp thông tin nhận dạng và mục tiêu cung cấp tư thế, biểu cảm, hướng nhìn, tóc, cơ thể, quần áo, bối cảnh ánh sáng, khung hình và nền. Một hệ thống trước tiên định vị và chuẩn hóa khuôn mặt, biểu diễn nhận dạng nguồn và các thuộc tính mục tiêu, tổng hợp một vùng khuôn mặt thay thế, sau đó tinh chỉnh và kết hợp vùng đó vào mục tiêu. Hệ thống video cũng phải giữ cho kết quả ổn định theo thời gian.

Bản đồ nghiên cứu, không phải tuyên bố về mô hình riêng: trang này giải thích các khái niệm được ghi lại trong các bài báo chính và đặc tả C2PA hiện tại. Nó không tiết lộ hoặc tuyên bố bộ phát hiện, bộ mã hóa, bộ tạo, tập huấn luyện, hàm mất mát, nhà cung cấp hoặc mô hình nào mà DeepSwapAI sử dụng trong sản xuất.

Sự khác biệt đó rất quan trọng. RetinaFace là bằng chứng hữu ích cho những gì định vị khuôn mặt và các điểm mốc có thể cung cấp; ArcFace là bằng chứng hữu ích cho biểu diễn nhận dạng; FaceShifter, BlendFace, DiffSwap và VividFace cho thấy các cách tiếp cận nghiên cứu khác nhau đối với chuyển giao nhận dạng, bảo toàn thuộc tính, che khuất và nhất quán theo thời gian. Việc đưa chúng vào đây không có nghĩa là chúng là thành phần của một hệ thống. Đối với hàng đợi ứng dụng, thanh toán, phân phối và lưu giữ thay vì các khái niệm mô hình, hãy sử dụng hướng dẫn kiến trúc pipeline sản xuất riêng.

Nhận dạng và cảnh có các vai trò khác nhau

Yếu tốThường đến từNhững gì hệ thống cố gắng làmXung đột phổ biến
Dấu hiệu nhận dạng khuôn mặtẢnh chân dung nguồnMang nhận dạng nguồn có thể nhận biết vào kết quảMờ, khuôn mặt nhỏ, điểm mốc yếu hoặc rò rỉ nhận dạng từ mục tiêu
Tư thế và biểu cảmPhương tiện mục tiêuGiữ hướng đầu, hướng nhìn, trạng thái miệng và biểu cảmKhớp tư thế kém hoặc nguồn che giấu các đặc điểm cần thiết
Tóc, tai, cơ thể và quần áoPhương tiện mục tiêuĐể nguyên nội dung cảnh không phải khuôn mặtMặt nạ cắt ngang tóc, kính, tay hoặc phụ kiện
Bối cảnh ánh sáng và màu sắcPhương tiện mục tiêuLàm cho vùng được chèn thuộc về cùng một cảnhPhơi sáng, cân bằng trắng, bóng hoặc nén khác nhau
Nền và khung hìnhPhương tiện mục tiêuGiữ nguyên bố cục gốcCắt xén, viền hoặc chuẩn hóa hình học không ổn định

Đây là sự phân chia khái niệm, không phải là sự đảm bảo rằng mọi pixel đều tuân theo nó một cách hoàn hảo. hướng dẫn chuẩn bị hai ảnh áp dụng các vai trò tương tự cho không gian làm việc hiện tại, trong khi bảng thuật ngữ kỹ thuật định nghĩa chuyển giao nhận dạng và bảo toàn thuộc tính mục tiêu với ranh giới nguồn.

Từ định vị khuôn mặt đến kết quả đã được xem xét

  1. Phát hiện và định vị khuôn mặt mục tiêu. Một bộ phát hiện ước tính hộp khuôn mặt và các điểm mốc. RetinaFace chứng minh một thiết kế nghiên cứu dự đoán đồng thời hộp khuôn mặt, điểm mốc 2D và đỉnh khuôn mặt 3D, minh họa lý do tại sao định vị có thể cung cấp nhiều hơn một vùng cắt hình chữ nhật.
  2. Căn chỉnh và chuẩn hóa vùng cắt khuôn mặt. Các phép biến đổi dựa trên điểm mốc đưa khuôn mặt vào tỷ lệ và hướng ổn định hơn. Pipeline VFX độ phân giải cao của Nirkin và các đồng nghiệp mô tả rõ ràng việc phát hiện, chuẩn hóa dựa trên điểm mốc, chuẩn hóa ngược và pha trộn.
  3. Biểu diễn nhận dạng nguồn. Bộ mã hóa nhận dạng ánh xạ khuôn mặt nguồn thành các đặc trưng nhằm phân biệt nhận dạng này với nhận dạng khác. ArcFace là một ví dụ chính về nhúng nhận dạng khuôn mặt phân biệt; BlendFace cho thấy lý do tại sao bộ mã hóa nhận dạng cũng có thể mang các thuộc tính không mong muốn và đóng khung việc tách rời như một vấn đề hoán đổi khuôn mặt.
  4. Điều kiện hóa trên các thuộc tính mục tiêu. Mục tiêu cung cấp tư thế, biểu cảm, hướng nhìn, bối cảnh ánh sáng và cảnh. FaceShifter mô tả việc tích hợp nhận dạng vào các thuộc tính mục tiêu, trong khi kết quả và các thử nghiệm cắt bỏ của nó tách biệt việc truy xuất nhận dạng khỏi việc xử lý thuộc tính và che khuất.
  5. Tổng hợp khuôn mặt thay thế. Phép biến đổi có thể được xây dựng với hướng dẫn 3D, bộ tạo đối nghịch, khuếch tán hoặc kết hợp. DiffSwap, ví dụ, sử dụng khuếch tán có mặt nạ nhận biết 3D; đó là một họ đã được công bố, không phải là một công thức phổ quát.
  6. Mặt nạ, tinh chỉnh và kết hợp. Vùng khuôn mặt được tạo ra phải trở về tọa độ mục tiêu và gặp các pixel gốc tại ranh giới đáng tin cậy. Che khuất, tóc, kính, tông màu da, độ tương phản và ánh sáng có thể yêu cầu mặt nạ và tinh chỉnh thay vì dán hình chữ nhật đơn giản.
  7. Ổn định và xem xét video theo thời gian. Video thêm sự tương ứng giữa các khung hình. Làm mịn điểm mốc, tạo có nhận thức thời gian và mặt nạ nhất quán có thể giảm rung, nhưng việc xem xét vẫn cần các khung hình xoay, nói, chớp mắt, chuyển động mờ, che khuất và phục hồi.

Phương pháp 3D, đối nghịch, khuếch tán và kết hợp giải quyết các bài toán con khác nhau

HọKhả năng hữu íchSự đánh đổi thiết kếVí dụ chính
Hướng dẫn 3DHình học khuôn mặt, tư thế và sự tương ứng rõ ràngƯớc tính hình học có thể không hoàn chỉnh xung quanh tóc, bên trong miệng, che khuất và góc nhìn cực đoanHigh-Resolution Neural Face Swapping
Đối nghịch / Dựa trên GANTổng hợp trực tiếp và tích hợp nhận dạng-thuộc tínhCác mục tiêu huấn luyện phải cân bằng nhận dạng, thuộc tính, tính chân thực và ranh giớiFaceShifter
Dựa trên khuếch tánTạo có điều kiện lặp và kiểm soát mặt nạThiết kế lấy mẫu, điều kiện hóa, tính toán, kiểm soát nhận dạng và ổn định thời gian vẫn là các quyết định riêng biệtDiffSwap
Video kết hợpKết hợp chi tiết nhận dạng ảnh với tính nhất quán nhận biết videoVẫn phải xử lý che khuất, chuyển động, biến đổi tư thế và trôi dạt giữa các khung hìnhVividFace
Đừng biến gia đình thành bảng xếp hạng. Kết quả của một bài báo phụ thuộc vào tập dữ liệu, cách triển khai, crop, bộ đánh giá, nén, số lượng mẫu và giao thức. Chỉ riêng nhãn kiến trúc không thiết lập được chất lượng, tốc độ, chi phí, độ an toàn hay tính phù hợp sản xuất.

Hầu hết các lỗi có thể nhìn thấy đều bắt nguồn từ việc thiếu bằng chứng hoặc bằng chứng mâu thuẫn

Khuôn mặt nhỏ hoặc bị mờ

Quá ít pixel có thể sử dụng làm suy yếu các điểm mốc, chi tiết nhận dạng, kết cấu da và ranh giới. Việc nâng tỷ lệ không thể tái tạo bằng chứng nhận dạng chưa từng được ghi lại.

Sự không khớp về tư thế lớn

Một tham chiếu chính diện cung cấp bằng chứng hạn chế cho một mục tiêu ở góc nghiêng, và các vùng mặt bị che khuất phải được suy luận. Khớp tham chiếu với góc mục tiêu quan trọng nhất khi có thể.

Che khuất và phụ kiện

Tay, tóc, kính, micro, mặt nạ và bóng đổ cắt ngang ranh giới khuôn mặt. Hệ thống phải quyết định pixel mục tiêu nào ở phía trước và pixel được tạo ra nào thuộc về phía sau chúng.

Xung đột ánh sáng và màu sắc

Độ phơi sáng, hướng ánh sáng, cân bằng trắng, độ tương phản và nén khác nhau có thể làm lộ ranh giới ngay cả khi việc chuyển đổi nhận dạng có thể nhận ra.

Biểu cảm và bên trong miệng

Lời nói, răng, lưỡi và biểu cảm cực đoan kết hợp hình học với kết cấu tinh tế. Một kết quả khớp nhận dạng vẫn có thể trông sai nếu biểu cảm mục tiêu không được bảo tồn.

Nén lặp lại

Phương tiện có tốc độ bit thấp có thể xóa chi tiết và tạo ra các khối hoặc hiệu ứng vòng. FaceForensics++ cũng chỉ ra rằng nén làm thay đổi điều kiện phát hiện thao tác, vì vậy cả việc xem xét tạo sinh và giải thích bộ phát hiện đều cần phương tiện đã được mã hóa thực tế.

Sử dụng bộ kiểm tra đầu vào cục bộ cho các kích thước có thể đo lường, độ chói, độ tương phản, cắt xén và chi tiết cạnh. Các phép đo đó chỉ mô tả đầu vào; chúng không dự đoán độ tương đồng nhận dạng, tính chân thực, sự thành công hay chất lượng đầu ra cuối cùng.

Một video hoán đổi khuôn mặt phải mạch lạc giữa các khung hình, không chỉ hấp dẫn trong ảnh tĩnh

Xử lý khung hình độc lập có thể khuếch đại những thay đổi nhỏ trong phát hiện, điểm mốc, mặt nạ, màu sắc hoặc đặc điểm nhận dạng thành hiện tượng nhấp nháy có thể nhìn thấy. Đường ống VFX mô tả quá trình ổn định điểm mốc trước khi kết xuất, trong khi VividFace coi tính nhất quán theo thời gian, che khuất và biến thể tư thế là những thách thức video rõ ràng. Đây là các phương pháp đã được công bố, không phải mô tả về triển khai riêng tư của DeepSwapAI.

Điểm xem xétNhững gì cần kiểm traTại sao một ảnh tĩnh là không đủ
Độ ổn định của điểm mốcMắt, mũi, miệng và hàm được neo giữCác thay đổi căn chỉnh nhỏ xuất hiện dưới dạng rung lắc
Tính liên tục của nhận dạngCác dấu hiệu nhận biết không bị trôi trong quá trình quay đầu hoặc nóiMỗi khung hình có thể hợp lý nhưng không nhất quán với các khung hình liền kề
Tính liên tục của ranh giớiĐường chân tóc, má, hàm và tai không bị nhấp nháyHình dạng và màu sắc mặt nạ có thể thay đổi theo thời gian
Phục hồi che khuấtKhuôn mặt trở lại sạch sẽ sau khi tay, tóc hoặc vật thể đi quaHiện tượng giả khó nhất thường xuất hiện sau khi vật che khuất di chuyển đi
Hành vi nénKhối chuyển động, hiệu ứng vòng và mất chi tiết sau khi xuấtMã hóa cuối cùng có thể tiết lộ các hiện tượng giả không có trong các khung hình xem trước

Giải thích hướng dẫn chuẩn bị video biến những khái niệm này thành một quy trình làm việc tìm kiếm clip.

Hỏi mối quan hệ nào mà mỗi phép đo đánh giá

Câu hỏiSo sánh vớiLoại bằng chứngRanh giới
Đầu ra có giống với nhận dạng nguồn không?Nhận dạng nguồnNhúng nhận dạng hoặc xem xét nhận dạng của con ngườiPhụ thuộc vào bộ nhận dạng, crop, dữ liệu, ngưỡng và giao thức
Nó có bảo tồn tư thế và biểu cảm mục tiêu không?Phương tiện mục tiêuĐiểm mốc, ước tính tư thế hoặc biểu cảm và xem xét trực quanMột kết quả khớp mục tiêu không phải là điểm số nhận dạng
Kết quả và ranh giới có mạch lạc về mặt thị giác không?Bối cảnh đầu ra và mục tiêuCác phép đo tri giác và xem xét có cấu trúc của con ngườiMột điểm tổng hợp có thể che giấu một khiếm khuyết cục bộ quan trọng
Phân bố tập hợp có thực tế không?Tập hợp được tạo ra và tập hợp tham chiếuCác số liệu cấp tập hợp như FIDFID không thể chấm điểm một hình ảnh một cách phòng thủ
Video có ổn định không?Khung hình và chuyển động theo thời gianCác số liệu thời gian kèm xem xét có dấu thời gianMột khung hình chính tốt không thiết lập tính nhất quán theo thời gian

Để biết các điều kiện tiên quyết và giải thích số liệu chính xác, hãy sử dụng bản đồ số liệu đánh giácó phiên bản. Để ghi lại một đầu ra có thể nhìn thấy mà không biến nó thành tuyên bố trên toàn nhà cung cấp, hãy sử dụng thẻ điểm xem xét của con người.

Ba câu hỏi khác nhau đòi hỏi ba công cụ khác nhau

01

Phát hiện

Một bộ phát hiện ước tính liệu phương tiện có chứa tín hiệu thao tác trong các điều kiện huấn luyện và kiểm tra của nó hay không. Nén, các phương pháp chưa từng thấy và sự thay đổi miền có thể thay đổi hiệu suất; một điểm số không phải là bằng chứng lịch sử.

02

Nguồn gốc

C2PA Content Credentials có thể mang các khẳng định có thể xác minh bằng mật mã và thông tin xác thực về nguồn gốc của một tài sản. Đặc tả kỹ thuật rõ ràng không quyết định liệu nội dung có đúng sự thật hay không.

03

Tiết lộ và cho phép

Người sáng tạo vẫn cần sự cho phép, bối cảnh và quyết định tiết lộ trung thực. Không có bộ phát hiện hay thông tin xác thực nào xác định sự đồng ý hoặc liệu việc sử dụng có hợp pháp, công bằng hay gây hiểu lầm hay không.

FaceForensics++ cung cấp bằng chứng điểm chuẩn chính cho các điều kiện phát hiện thao tác và nén. Đặc tả kỹ thuật C2PA 2.4 là nguồn chính cho các khẳng định nguồn gốc và xác thực. Đọc công cụ lập kế hoạch đồng ý và tiết lộ để có quyết định của con người mà tín hiệu kỹ thuật không thể thay thế.

Năng lực kỹ thuật không thiết lập sự cho phép

Chỉ sử dụng hoán đổi khuôn mặt với các quyền và sự cho phép cần thiết. Không sử dụng nó để mạo danh, gian lận, quấy rối, nội dung tình dục liên quan đến một người mà không có sự cho phép, nội dung liên quan đến trẻ vị thành niên, tuyên bố chính trị hoặc thương mại lừa dối, tài liệu nhận dạng, kiểm soát truy cập hoặc các hoạt động bị cấm khác. Bảo quản các tệp gốc, ghi lại mục đích sử dụng và cơ sở đồng ý dự kiến, xem xét bản xuất chính xác và tiết lộ các chỉnh sửa quan trọng khi bối cảnh có thể gây hiểu lầm cho khán giả.

Giới hạn sản phẩm: trình giải thích này không đảm bảo rằng một đầu vào cụ thể sẽ được chấp nhận, hoàn thành, chính xác, thực tế, ổn định theo thời gian hoặc phù hợp cho một mục đích sử dụng cụ thể. Các quy tắc dịch vụ hiện tại có trong Điều khoản và các thông tin thực tế về sản phẩm hiện tại có trong Trung tâm tin cậy.

Các tài liệu chính giải thích từng khái niệm; chúng không mô tả một ngăn xếp ẩn

Nhóm sản phẩm DeepSwapAI đã xem xét các tài liệu chính bên dưới và đặc tả C2PA 2.4 vào ngày 28 tháng 7 năm 2026. Chúng tôi chỉ sử dụng mỗi nguồn cho khái niệm mà nó hỗ trợ trực tiếp và giữ các ví dụ nghiên cứu tách biệt khỏi các tuyên bố về sản phẩm hiện tại. Xem phương pháp xác minh tuyên bố để biết giới hạn biên tập.

Câu trả lời ngắn với ranh giới bằng chứng

Hoán đổi khuôn mặt AI thay đổi những gì?

Nó nhằm mục đích chuyển các tín hiệu nhận dạng nguồn trong khi vẫn giữ nguyên tư thế, biểu cảm, tóc, cơ thể, quần áo, bối cảnh ánh sáng, khung hình và nền của mục tiêu. Ranh giới chính xác phụ thuộc vào phương pháp và đầu vào.

Điều này có tiết lộ mô hình DeepSwapAI không?

Không. Nghiên cứu công khai giải thích các khái niệm; nó không phải là bằng chứng cho thấy một thành phần được trích dẫn được sử dụng trong sản xuất.

Tại sao sự không khớp về tư thế lại gây hại?

Các vùng bị ẩn hoặc định hướng khác nhau có bằng chứng tương ứng yếu hơn, vì vậy hệ thống phải suy luận nhiều nội dung hơn.

Tại sao một khung hình tốt vẫn có thể tạo ra một video kém?

Nhận dạng, điểm mốc, mặt nạ, màu sắc và ranh giới có thể bị trôi giữa các khung hình có vẻ hợp lý khác.

Một số liệu có thể chứng minh chất lượng không?

Không. Nhận dạng, bảo tồn mục tiêu, ranh giới, chất lượng cảm nhận và độ ổn định theo thời gian là những câu hỏi riêng biệt.

Trình phát hiện hoặc Thông tin xác thực nội dung có chứng minh sự thật không?

Không. Phát hiện ước tính tín hiệu thao tác theo một giao thức; thông tin nguồn gốc ghi lại các xác nhận và thông tin xác thực. Cả hai đều không xác định sự thật thực tế hoặc sự cho phép.

Chuẩn bị đầu vào với bằng chứng có thể đo lường được

Kiểm tra kích thước nguồn và mục tiêu, độ chói, độ tương phản, cắt xén và chi tiết cạnh cục bộ trước khi mở không gian làm việc hoán đổi khuôn mặt.

Mở trình kiểm tra đầu vào cục bộ