Tài liệu tham khảo kỹ thuật có trích dẫn nguồn
Bảng thuật ngữ hoán đổi khuôn mặt AI
Định nghĩa bằng tiếng Anh đơn giản cho 24 thuật ngữ được sử dụng trong nghiên cứu và đánh giá hoán đổi khuôn mặt, mỗi thuật ngữ đi kèm với một nguồn chính và một ranh giới ngăn chặn việc khẳng định quá mức.
Câu trả lời trực tiếp
Thuật ngữ hoán đổi khuôn mặt cần một định nghĩa và một giới hạn
Khuôn mặt nguồn cung cấp các dấu hiệu nhận dạng. Phương tiện mục tiêu cung cấp cảnh và các thuộc tính phi nhận dạng dự định. Phát hiện, căn chỉnh, tạo mặt nạ và tạo mô tả các phần của quy trình làm việc; độ tương đồng danh tính, số liệu tri giác và đánh giá của con người trả lời các câu hỏi đánh giá khác nhau.
Chỉ mục thuật ngữ
Chuyển đến khái niệm bạn cần
Nền tảng quy trình làm việc
Nền tảng quy trình làm việc
Các vai trò phương tiện và thuật ngữ tiền xử lý hình học xác định những gì đi vào quy trình làm việc hoán đổi khuôn mặt.
Hoán đổi khuôn mặt
#Còn được gọi là: Hoán đổi khuôn mặt AI, hoán đổi khuôn mặt
Một tác vụ thị giác máy tính chuyển các dấu hiệu nhận dạng từ khuôn mặt nguồn vào hình ảnh hoặc video mục tiêu trong khi cố gắng bảo tồn các thuộc tính mục tiêu như tư thế, biểu cảm, tóc và nền.
Ranh giới bằng chứng: Đây là định nghĩa tác vụ, không phải là đảm bảo rằng mọi hệ thống đều bảo tồn mọi thuộc tính hoặc một mục đích sử dụng cụ thể có sự cho phép.
Nguồn chính: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; Fine-Grained Face Swapping via Regional GAN Inversion
Mặt nguồn
#Còn được gọi là: danh tính nguồn, tham chiếu danh tính
Người hoặc hình ảnh tham chiếu cung cấp các dấu hiệu nhận dạng dành cho khuôn mặt được tạo ra.
Ranh giới bằng chứng: Nguồn thường không xác định cảnh mục tiêu, cơ thể, tóc, tư thế hoặc nền, và sự phân chia chính xác phụ thuộc vào phương pháp.
Nguồn chính: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; Reinforced Disentanglement for Face Swapping without Skip Connection
Phương tiện mục tiêu
#Còn được gọi là: hình ảnh mục tiêu, video mục tiêu
Hình ảnh hoặc video cung cấp cảnh và các thuộc tính phi nhận dạng mà phương pháp hoán đổi khuôn mặt cố gắng giữ lại.
Ranh giới bằng chứng: Các phương pháp khác nhau về mức độ giữ lại các thuộc tính mục tiêu, vì vậy việc bảo tồn mục tiêu phải được đánh giá thay vì giả định.
Nguồn chính: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Phát hiện khuôn mặt
#Còn được gọi là: định vị khuôn mặt, bản địa hóa khuôn mặt
Quá trình xác định một hoặc nhiều vùng khuôn mặt trong hình ảnh hoặc khung video trước khi căn chỉnh, trích xuất đặc trưng hoặc tạo.
Ranh giới bằng chứng: Một vùng khuôn mặt được phát hiện không phải là quyết định danh tính, kiểm tra sự đồng ý hoặc bằng chứng rằng xử lý sau đó sẽ thành công.
Nguồn chính: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild
Điểm mốc khuôn mặt
#Còn được gọi là: điểm mốc khuôn mặt, điểm mốc
Các điểm chính trên khuôn mặt được ước tính, chẳng hạn như khóe mắt, mũi và vị trí miệng, được sử dụng để mô tả hình dạng khuôn mặt cho việc căn chỉnh hoặc điều kiện hóa.
Ranh giới bằng chứng: Bố cục điểm mốc, số lượng điểm và đơn vị lỗi khác nhau tùy theo bộ phát hiện và giao thức; chúng không thể hoán đổi trực tiếp.
Nguồn chính: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild; DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion
Căn chỉnh khuôn mặt
#Còn được gọi là: căn chỉnh khuôn mặt, crop khuôn mặt đã căn chỉnh
Một bước chuẩn hóa hình học sử dụng cấu trúc khuôn mặt được phát hiện để đặt khuôn mặt vào một crop, tỷ lệ và hướng nhất quán cho xử lý tiếp theo.
Ranh giới bằng chứng: Các quy ước và phép biến đổi căn chỉnh khác nhau, và một crop đã căn chỉnh không thiết lập danh tính, chất lượng hoặc sự cho phép.
Nguồn chính: RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild; ArcFace: Additive Angular Margin Loss for Deep Face Recognition
Danh tính và bảo tồn
Danh tính và bảo tồn
Các khái niệm được sử dụng để tách các dấu hiệu nhận dạng nguồn khỏi các thuộc tính mục tiêu mà kết quả cố gắng giữ lại.
Nhúng khuôn mặt
#Còn được gọi là: nhúng danh tính, vectơ đặc trưng khuôn mặt
Một biểu diễn số đã được học được thiết kế để các hình ảnh khuôn mặt có thể được so sánh trong không gian đặc trưng theo một mô hình nhận dạng cụ thể và giao thức tiền xử lý.
Ranh giới bằng chứng: Kích thước vectơ, hàm khoảng cách và ngưỡng quyết định phụ thuộc vào mô hình và thiết lập đánh giá; một nhúng không phải là phán quyết danh tính hoặc được đảm bảo toán học là không thể tái tạo.
Nguồn chính: ArcFace: Additive Angular Margin Loss for Deep Face Recognition
Độ tương đồng danh tính
#Còn được gọi là: giữ lại danh tính, điểm bảo tồn danh tính
Một so sánh phụ thuộc vào giao thức giữa các biểu diễn nguồn-gốc và đầu ra, thường được tính từ một bộ mã hóa khuôn mặt được đặt tên và hàm tương đồng.
Ranh giới bằng chứng: Điểm số không thể chuyển đổi giữa các bộ mã hóa, crop, tập dữ liệu, ngưỡng hoặc nhân khẩu học và không nên được trình bày như một phán quyết sinh trắc học cho một đầu ra.
Nguồn chính: ArcFace: Additive Angular Margin Loss for Deep Face Recognition; PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion
Bảo tồn thuộc tính mục tiêu
#Còn được gọi là: bảo tồn thuộc tính, nhất quán mục tiêu
Mức độ mà kết quả giữ lại các đặc điểm mục tiêu dự định như tư thế, biểu cảm, tóc, ánh sáng, quần áo và nền trong khi thay đổi các dấu hiệu nhận dạng khuôn mặt.
Ranh giới bằng chứng: Các thuộc tính và bộ ước tính được đánh giá phải được nêu tên; một điểm tổng hợp có thể che giấu sự thất bại trong một thuộc tính riêng lẻ.
Nguồn chính: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Mặt nạ khuôn mặt
#Còn được gọi là: mặt nạ hoán đổi, mặt nạ khuôn mặt
Một bản đồ không gian xác định vùng hình ảnh nào có thể được tạo, pha trộn hoặc đánh giá như một phần của thao tác hoán đổi khuôn mặt.
Ranh giới bằng chứng: Cấu trúc và ngữ nghĩa mặt nạ khác nhau tùy theo phương pháp; một mặt nạ tự nó không giải quyết được sự che khuất, ranh giới hoặc sự không nhất quán màu sắc.
Nguồn chính: DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion; Fine-Grained Face Swapping via Regional GAN Inversion
Phân tích khuôn mặt
#Còn được gọi là: phân đoạn ngữ nghĩa khuôn mặt
Phân đoạn ngữ nghĩa cấp pixel của các thành phần khuôn mặt và các vùng xung quanh, chẳng hạn như da, mắt, miệng, tóc hoặc nền.
Ranh giới bằng chứng: Bộ nhãn và chất lượng phân đoạn phụ thuộc vào bộ phân tích và tập dữ liệu, các vùng không chính xác có thể lan truyền vào quá trình tổng hợp hoặc ghép ảnh sau này.
Nguồn chính: Fine-Grained Face Swapping via Regional GAN Inversion
Pha trộn ranh giới khuôn mặt
#Còn được gọi là: pha trộn ranh giới, ghép khuôn mặt
Bước tổng hợp chuyển đổi vùng khuôn mặt đã tổng hợp vào mục tiêu xung quanh tông màu da, cạnh, ánh sáng và nội dung lân cận.
Ranh giới bằng chứng: Một ranh giới mượt mà về mặt thị giác không thiết lập được danh tính chính xác, các đặc điểm nội tại tự nhiên hoặc hành vi nhất quán qua các khung hình video.
Nguồn chính: Fine-Grained Face Swapping via Regional GAN Inversion; Reinforced Disentanglement for Face Swapping without Skip Connection
Che khuất
#Còn được gọi là: che mặt, khuôn mặt bị che khuất
Một tình trạng trong đó một phần khuôn mặt bị che bởi tóc, tay, kính, đồ vật, người khác hoặc ranh giới hình ảnh.
Ranh giới bằng chứng: Xử lý che khuất phụ thuộc vào phương pháp và bối cảnh; một chuẩn đánh giá phải chỉ rõ vùng bị ảnh hưởng và điều kiện quan sát.
Nguồn chính: Fine-Grained Face Swapping via Regional GAN Inversion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Tư thế đầu
#Còn được gọi là: tư thế khuôn mặt, hướng đầu
Hướng ước tính của đầu so với máy ảnh, thường được biểu diễn bằng góc xoay, góc nghiêng và góc lật hoặc bằng các điểm mốc và tham số 3D.
Ranh giới bằng chứng: Giá trị tư thế phụ thuộc vào bộ ước lượng và quy ước tọa độ; chỉ khớp tư thế không thể dự đoán được tính chân thực của đầu ra.
Nguồn chính: DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion; PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion
Biểu cảm khuôn mặt
#Còn được gọi là: bảo tồn biểu cảm
Cấu hình có thể nhìn thấy của các đặc điểm khuôn mặt liên quan đến các chuyển động như cười, chớp mắt hoặc mở miệng, thường được coi là một thuộc tính mục tiêu trong hoán đổi khuôn mặt.
Ranh giới bằng chứng: Nhãn và tham số biểu cảm phụ thuộc vào bộ ước lượng và có thể bỏ sót các hành vi tinh tế, bất đối xứng hoặc được diễn giải theo văn hóa.
Nguồn chính: PixSwap: High-Resolution Face Swapping for Effective Reflection of Identity via Diffusion; DynamicFace: High-Quality and Consistent Face Swapping for Image and Video
Nhất quán video
Nhất quán video
Các khái niệm về chuyển động và chuỗi khung hình không tồn tại trong một ảnh tĩnh đơn lẻ.
Nhất quán thời gian
#Còn được gọi là: nhất quán thời gian, nhất quán giữa các khung hình
Sự ổn định của các dấu hiệu nhận dạng, thuộc tính mục tiêu và chi tiết hình ảnh qua các khung video liên tiếp thay vì trong một khung riêng lẻ.
Ranh giới bằng chứng: Một phép đo nhất quán cao có thể bảo tồn kết quả sai một cách nhất quán, do đó tính chính xác của danh tính và chất lượng hiển thị phải được đánh giá riêng biệt.
Nguồn chính: DynamicFace: High-Quality and Consistent Face Swapping for Image and Video; CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation
Luồng quang học
#Còn được gọi là: trường chuyển động, tương ứng điểm ảnh
Một trường chuyển động dày đặc ước tính ánh xạ các vị trí hình ảnh giữa các khung và có thể hỗ trợ phân tích chuyển động, biến dạng hoặc chẩn đoán thời gian.
Ranh giới bằng chứng: Dòng quang học là một ước lượng có thể thất bại xung quanh vùng che khuất, mờ, thay đổi ánh sáng và các vùng mới xuất hiện; bản thân nó không phải là điểm chất lượng.
Nguồn chính: RAFT: Recurrent All-Pairs Field Transforms for Optical Flow; CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation
Đánh giá
Đánh giá
Các số liệu và giao thức đánh giá trả lời các câu hỏi chất lượng khác nhau trong các điều kiện rõ ràng.
Structural Similarity Index (SSIM)
#Còn được gọi là: SSIM
Một thước đo tương đồng hình ảnh tham chiếu đầy đủ so sánh độ chói, độ tương phản và cấu trúc giữa hình ảnh kiểm tra và hình ảnh tham chiếu.
Ranh giới bằng chứng: SSIM yêu cầu một tham chiếu căn chỉnh có ý nghĩa, không dành riêng cho khuôn mặt, và giá trị của nó phụ thuộc vào tỷ lệ, cửa sổ, xử lý màu sắc và tiền xử lý.
Nguồn chính: Image Quality Assessment: From Error Visibility to Structural Similarity
Learned Perceptual Image Patch Similarity (LPIPS)
#Còn được gọi là: LPIPS, độ tương tự cảm nhận đã học
Một khoảng cách tri giác dựa trên các đặc trưng mạng sâu được đánh giá dựa trên đánh giá của con người về độ tương đồng của các mảnh hình ảnh.
Ranh giới bằng chứng: LPIPS không phải là điểm danh tính; giá trị phụ thuộc vào mạng đã chọn, hiệu chuẩn, chuẩn bị hình ảnh và giao thức so sánh.
Nguồn chính: The Unreasonable Effectiveness of Deep Features as a Perceptual Metric
Frechet Inception Distance (FID)
#Còn được gọi là: FID
Một khoảng cách cấp tập hợp giữa các phân bố đặc trưng từ các bộ sưu tập hình ảnh được tạo và tham chiếu, ban đầu được tính bằng các đặc trưng Inception.
Ranh giới bằng chứng: FID không phải là điểm ảnh đơn lẻ có thể bảo vệ được, và kết quả phụ thuộc vào số lượng mẫu, bộ trích xuất đặc trưng, tiền xử lý, tập tham chiếu và cách triển khai.
Nguồn chính: GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium; Rethinking FID: Towards a Better Evaluation Metric for Image Generation
Đánh giá chất lượng không tham chiếu
#Còn được gọi là: NR-IQA, đánh giá chất lượng hình ảnh mù
Một phương pháp ước tính chất lượng hình ảnh từ đầu ra mà không yêu cầu hình ảnh tham chiếu gốc đi kèm.
Ranh giới bằng chứng: Tính hợp lệ của nó phụ thuộc vào dữ liệu huấn luyện và thiết kế xác thực; điểm số có thể thất bại trên các phương pháp, nội dung hoặc biến dạng chưa từng thấy.
Nguồn chính: Rank-based No-reference Quality Assessment for Face Swapping
Phiếu đánh giá của người đánh giá
#Còn được gọi là: tiêu chí đánh giá của con người, tiêu chí đánh giá đầu ra
Một tiêu chí có thể lặp lại yêu cầu người đánh giá ghi lại các tiêu chí có thể nhìn thấy, điểm neo đánh giá, cổng kiểm tra quan trọng và ghi chú cho một đầu ra cụ thể.
Ranh giới bằng chứng: Nó ghi lại các quan sát có cấu trúc của con người, không phải độ chính xác của mô hình, danh tính sinh trắc học, xác suất hay xếp hạng trên toàn bộ nhà cung cấp.
Nguồn chính: Phiếu đánh giá chất lượng đầu ra hoán đổi khuôn mặt DeepSwapAI; Rank-based No-reference Quality Assessment for Face Swapping
Nguồn gốc
Nguồn gốc
Tiêu chuẩn ghi lại nguồn gốc nội dung số và những gì đã xảy ra với nó.
C2PA
#Còn được gọi là: Liên minh về Xuất xứ và Tính xác thực của Nội dung
Một tiêu chuẩn kỹ thuật mở để ghi lại thông tin nguồn gốc chống giả mạo về nội dung kỹ thuật số thông qua các tuyên bố, khẳng định, thành phần và yêu cầu đã ký.
Ranh giới bằng chứng: C2PA có thể cung cấp bằng chứng về nguồn gốc và tín hiệu giả mạo, nhưng đặc tả kỹ thuật không xác định liệu nội dung được mô tả có đúng, chính xác hay được phép về mặt đạo đức hay không.
Nguồn chính: C2PA Technical Specification 2.4; Giải thích C2PA 2.3
Thông tin xác thực nội dung
#Còn được gọi là: Chứng chỉ Nội dung C2PA, chứng chỉ xuất xứ nội dung
Việc trình bày thông tin nguồn gốc hướng đến người dùng liên quan đến một tài sản kỹ thuật số thông qua hệ sinh thái C2PA.
Ranh giới bằng chứng: Tính khả dụng và chi tiết hiển thị phụ thuộc vào chứng chỉ, người ký, người xác thực, tài sản và nền tảng; chứng chỉ không phải là tuyên bố rằng nội dung là đúng sự thật.
Nguồn chính: Giải thích C2PA 2.3; C2PA Technical Specification 2.4
Giải thích chỉ số
Bốn quy tắc ngăn chặn so sánh sai lệch
Đặt tên cho mối quan hệ
Các chỉ số nhận dạng thường so sánh đầu ra với nhận dạng nguồn. Việc bảo tồn biểu cảm và tư thế thường so sánh đầu ra với mục tiêu. Đây là những câu hỏi khác nhau.
Giữ nguyên giao thức
Tập dữ liệu, crop, bộ đánh giá, tiền xử lý, triển khai, số lượng mẫu và tổng hợp đều có thể thay đổi giá trị được báo cáo. Một tên chỉ số chung là không đủ.
Giữ bằng chứng cấp tập hợp và đầu ra đơn lẻ riêng biệt
FID mô tả phân phối tập hợp ảnh. SSIM và LPIPS yêu cầu một tham chiếu so sánh có ý nghĩa. Một bảng điểm của con người ghi lại các quan sát có thể nhìn thấy về một đầu ra đã được đánh giá.
Không làm mờ mọi khía cạnh chất lượng
Bản sắc, bảo toàn thuộc tính mục tiêu, ranh giới, che khuất, tính toàn vẹn kỹ thuật và ổn định thời gian có thể thất bại độc lập và cần được kiểm tra.
Câu hỏi về bảng thuật ngữ
Cách sử dụng các định nghĩa này
Trang này có tiết lộ chính xác ngăn xếp mô hình DeepSwapAI không?
Không. Nó định nghĩa các khái niệm trong ngành và nghiên cứu mà không khẳng định rằng mọi phương pháp được trích dẫn đều là một phần của triển khai sản xuất.
Tôi có thể so sánh cùng một chỉ số giữa hai bài báo không?
Chỉ sau khi kiểm tra rằng các tập dữ liệu, bộ đánh giá, tiền xử lý, triển khai và quy tắc tổng hợp khớp nhau.
FID có thể đo lường một đầu ra không?
Không. FID là một thước đo ở cấp độ phân phối và cần các tập ảnh được tạo ra và ảnh tham chiếu.
Chứng chỉ Nội dung có chứng minh một hình ảnh là thật không?
Không. Chúng cung cấp thông tin về nguồn gốc và tín hiệu xác thực, không phải là phán quyết về sự thật thực tế.
Áp dụng các thuật ngữ cho một đầu ra có thể nhìn thấy
Sử dụng thẻ điểm miễn phí để xem xét danh tính, ranh giới, tư thế, ánh sáng, sự che khuất, tính toàn vẹn kỹ thuật và độ ổn định video mà không biến một mẫu thành một tuyên bố trên toàn nhà cung cấp.