质量评分卡
质量评分卡
质量评分卡. 适用于获准照片、批量、合照映射、视频和 GIF 工作流的浏览器 AI 换脸。 Conteúdo localizado: zh-CN. 来源核验比较.
实用指南
质量评分卡
本页以中文说明质量评分卡的用途、边界与核验方式。页面下方保留已审核的产品事实、数字、链接和来源;请在获得相关人员许可后使用媒体。
来源核验比较: 适用于获准照片、批量、合照映射、视频和 GIF 工作流的浏览器 AI 换脸。
直接回答
人脸交换质量评分需要可见的标准和证据边界
此评分卡用于对单个特定输出进行人工审查的结构化流程。它不进行生物特征层面的人脸检查,不预测未见过的结果,也不将单个有利样本转化为对整个模型或提供商的声明。
交互式评估
使用同一标准对单个输出进行评分
选择媒体类型,完成关卡,对每个适用标准进行评分,并为任何其他审查员应能发现的内容保留简短证据备注。
评分锚点
对每个标准使用相同的0到4含义
该量表描述在样本材料中针对该标准观察到的最强缺陷。它不是置信度分数、概率或生物特征测量值。
| 评分 | 锚点 | 定义 |
|---|---|---|
| 0 | 无法使用 | 失败或严重缺陷阻止了预期用途。 |
| 1 | 重大缺陷 | 一个清晰可见的缺陷主导了正常观看。 |
| 2 | 明显缺陷 | 缺陷仍然容易注意到,需要针对性修正。 |
| 3 | 轻微缺陷 | 审查时可见一个小缺陷,但不主导正常观看。 |
| 4 | 未观察到实质性缺陷 | 在此标准的样本输出中未观察到实质性缺陷。 |
评分维度
权重明确,仅在存在运动时才对运动进行评分
视频和GIF使用全部100个基础权重点。照片排除时间稳定性,并将剩余的90点归一化为100分结果。
| 标准 | 基础权重 | 媒体 | 审查问题 |
|---|---|---|---|
| 身份保留 | 24% | 照片、视频、gif | 可见的眼睛、眉毛、鼻子、嘴巴、下巴、年龄线索和整体身份是否与预期参考保持一致? |
| 人脸边界与融合 | 16% | 照片、视频、gif | 皮肤纹理、面部边缘、耳朵、下巴、发际线和颈部是否无缝过渡到目标场景,而没有粘贴的边界感? |
| 姿态与表情一致性 | 14% | 照片、视频、gif | 面部几何形状是否与目标头部角度、视线、眼睛状态、嘴巴形状和表情保持一致? |
| 光照与色彩连续性 | 14% | 照片、视频、gif | 曝光、颜色、皮肤阴影、高光和阴影是否与目标场景保持一致? |
| 遮挡与配饰连续性 | 12% | 照片、视频、gif | 头发、手、眼镜、口罩、麦克风、前景物体和其他遮挡物是否保持在正确的视觉顺序中? |
| 技术完整性 | 10% | 照片、视频、gif | 输出是否没有明显的模糊、振铃、块状伪影、撕裂、重复特征、突然的纹理变化或损坏的帧? |
| 时间稳定性 | 10% | 视频、gif | 在运动过程中,身份是否保持稳定,没有闪烁、漂移、面部丢失、突然的几何变化或可见的循环接缝? |
下载可重复使用的协议
JSON包含完整的量表、关卡、标准、公式、决策区间、证据限制、许可和参考文献。CSV是一个空白的七行审查模板,BibTeX文件提供稳定的引用。
自动化基准测试地图
人脸交换质量指标回答不同的问题
一个可辩护的基准测试应保持源身份转移、目标属性保留、图像和视频分布真实性、帧间行为、仅输出评估和人工审查的分离。版本化的决策地图命名了每个系列比较的内容以及解释数值所需的协议。
| 测量指标 | 比较对象 | 用途 | 边界 |
|---|---|---|---|
| 身份检索或嵌入相似度 | 源身份与交换输出,使用命名的人脸编码器或源库。 | 在固定评估器下,输出保留源身份证据的强度如何?在相同协议内,更高的相似度或检索性能通常更好。 | 编码器、裁剪、库、人口统计、阈值和预处理会影响数值。它不是针对单个人的生物特征判定。 |
| 逐帧身份相似度稳定性 | 在检测到的输出帧上,源到输出身份相似度的序列,使用一个命名的人脸编码器。 | 随着姿态、表情、遮挡和场景条件随时间变化,源身份证据是否保持稳定?仅在同时报告平均身份相似度或检索结果时,较低的离散度可能表明更高的稳定性。 | 一个持续错误的身份可能具有低方差。离散度不能替代平均相似度或检索,且数值不能跨编码器或帧处理流程移植。 |
| 姿态与表情误差 | 目标姿态或表情估计与交换输出,使用命名的估计器。 | 在固定估计器下,输出保留目标头部姿态和表情的紧密程度如何?在相同的估计器和参数化下,较低误差通常更好。 | 数值不能跨不同的估计器、裁剪、参数空间、地标约定或预处理流程移植。 |
| Frechet Inception Distance (FID) | 生成的图像或帧分布与记录的参考分布。 | 在固定特征提取器和采样协议下,两个特征分布的接近程度如何?仅在相同数据集、提取器、预处理和样本协议下,较低值更好。 | 单个人脸交换输出不能有可辩护的FID,因为单张图像不是分布。FID不隔离身份正确性。 |
| Frechet Video Distance (FVD) | 生成的视频片段分布与记录的参考片段分布,使用命名的视频特征提取器。 | 在固定片段采样协议下,生成和参考视频特征分布的接近程度如何?仅在相同数据集、特征提取器、片段时长、帧率、预处理和样本协议下,较低值更好。 | 单个输出片段不是可辩护的分布级FVD结果。FVD不隔离源身份、目标属性保留、唇同步或特定的时间缺陷。 |
| 主体与背景一致性 | 跨输出帧以及相对于前序、目标或参考帧的特征一致性。 | 在固定视频协议下,主体和背景特征在运动中的稳定性如何?在相同实现下,更高的一致性通常更好。 | 仅凭一致性不能建立正确的身份映射、视觉真实感、运动准确性或发布就绪性。 |
| 注视、眼睑开度、唇同步及运动诊断 | 目标与输出序列之间命名的眼睛、音频-嘴唇、地标或光流行为。 | 哪些特定的动态目标属性在生成的视频中保持同步?方向和单位取决于命名的诊断;分别报告每个诊断。 | 这些诊断不可互换,需要记录在案的视频协议,且不适用于每种媒体类型。 |
| 学习的无参考质量评估 | 仅输出本身,由针对排名人工判断或标记质量数据训练的模型评估。 | 当明确的参考媒体不可用时,训练有素的评估器如何对可见输出质量进行排名?方向取决于模型输出;在记录在案的保留分布上进行验证。 | 性能取决于训练数据和验证范围。仅输出分数本身不能建立正确的源身份转移。 |
| 结构化人工评分卡 | 一个可见输出,对照明确的缺陷锚点、发布关卡和审查员备注。 | 审查员在此特定输出中观察到哪些可见缺陷或未解决的使用关卡?使用锚定顺序评分;不要将结果重新解释为概率或生物特征分数。 | 关于审查样本的主观证据,而非模型准确性、提供商排名、概率或生物特征相似度。 |
已发布的基准测试协议不可互换
下面的对照表仅记录主要论文描述的设置。它不复制其结果表,不声称每个数据集都可下载,也不将来自不同评估器的数值转化为一个排行榜。
| 协议与来源 | 比较单元 | 报告的测量指标 | 可比性边界 |
|---|---|---|---|
| CASIA FaceSwapping | 根据三个因素隔离协议组装的源-目标视频对。正常:来自正常录制的4,500对不重叠的同种族对。跨种族:1,200对涵盖亚洲、非洲和高加索群体之间的双向对。跨属性:4,300对涵盖正常以及姿态、表情或光照变化的双向对。 | 身份检索、身份相似度、姿态误差、表情误差、FID、主体一致性、背景一致性。此对照表中未总结人工审查协议。 | 三个切片在CASIA设置内隔离了不同因素。它们的数值取决于该论文的对构建、模型、特征提取器、分辨率和聚合方式。 |
| IDBench-V | 200对论文报告的源视频和目标图像真实世界对。一个200对评估集,涵盖小尺寸人脸、极端头部姿态、严重遮挡、复杂或动态表情以及杂乱的多人物场景。 | ArcFace身份相似度、InsightFace身份相似度、CurricularFace身份相似度、逐帧身份相似度方差、姿态误差、表情误差、背景一致性、主体一致性、运动平滑度、FVD。该论文报告了19个评估器,使用1-5分制对身份相似度、属性保留和视频质量进行评分。 | 该行仅记录论文报告的协议。它不声称公开下载可用性,不重现结果,也不使其数值可移植到另一个基准测试。 |
| CanonSwap VFS基准测试 | 从VFHQ采样的100对源-目标对;每个目标使用前100帧和对应的四秒音频。一个100对视频人脸交换评估集,具有固定的帧和音频窗口。 | 身份相似度、身份检索、姿态误差、表情误差、视线误差、眼纵横比误差、LSE-D、LSE-C、光流时间一致性、FVD。此对照表中未总结人工审查协议。 | 该协议使用论文特定的帧、音频、估计器和特征提取器选择。其数值不得直接与IDBench-V或CASIA数值进行比较。 |
下载指标决策地图
JSON保留了所有9个指标系列、3个协议对照表、先决条件、解释方向、证据边界和主要来源。CSV包含指标系列表;BibTeX记录提供稳定的归属。
五步评估协议
使每次审查具有足够的可重复性,以便其他人可以检查
- 选择输出类型并识别样本。 选择照片、视频或GIF,并记录样本标识符、审核员和审核日期。
- 确认三个关键发布关卡。 确认权限,验证预期的身份映射,并审查是否需要AI内容披露。
- 审查每个适用标准。 在适用的情况下对身份、人脸边界、姿态与表情、光照、遮挡、技术完整性和时间稳定性进行评分。
- 读取加权结果,不覆盖关卡。 使用结果来优先安排修正。数值分数绝不能覆盖未解决的权限、映射或披露门控。
- 导出完整证据记录。 下载JSON或CSV,保留备注,并对您打算比较的每个输出重复相同的协议。
证据边界与来源
主观评价仅在可见其局限性时才有用
边界
该分数是对一个评审输出的结构化人工观察,而非生物特征身份测量。
边界
该评分标准不确立模型准确性、平均质量、安全性、速度、可靠性或提供商优越性。
边界
高分不能替代同意、披露、法律、可访问性或特定受众的评审。
边界
跨提供商的主张需要相同的输入、重复运行、独立评审员、记录在案的查看条件和统计报告。
- ITU-R BT.500-15: Methodologies for the subjective assessment of the quality of television images - 记录在案的主观图像评估通用原则;DeepSwapAI 评分标准并非 ITU 实验室测试。
- ITU-T P.910 (10/2023): Subjective video quality assessment methods for multimedia applications - 记录在案的主观多媒体评估通用原则;DeepSwapAI 评分标准是一种实用的单次评审工作流程。
- Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark - 定义 CASIA 人脸交换基准,并记录身份、目标属性、分布和视频一致性协议。
- DreamID-V: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer - 引入 200 对 IDBench-V 协议,并报告多编码器身份相似度、逐帧方差、目标属性、视频一致性、FVD 和人工评审指标。
- CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation - 报告视频特定的身份、目标属性、同步、时间一致性和分布指标。
- Rank-based No-reference Quality Assessment for Face Swapping - 研究基于学习、仅使用输出的换脸质量评估,针对排序判断进行训练。
- GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium - 引入 Fréchet Inception Distance 作为分布级评估指标。
- DeepSwapAI 受控输入就绪性研究 - 仅分离输入证据,无生成输出分数。
- 带版本号的公开评分卡镜像 - 开放研究仓库中的 v1.6.2 副本。
- 校验和验证的开放研究发布 - 清单、SHA-256 校验和、引用文件、JSON 和 CSV。
- Software Heritage 仓库快照 - 独立保存为 swh:
1: .snp: f11738615eea 9f999c8709a0 da73130f0426 6209 - DeepSwapAI声明验证方法论 - 产品事实、比较和证据边界的审查方式。
评分卡问题
该数字能及不能确立什么
这会上传我的媒体或笔记吗?
不会。该页面没有媒体输入,评分卡控件不会将评分或笔记发送给 DeepSwapAI。
这是生物特征身份评分吗?
不是。它是对可见输出特征的结构化人工观察,而非人脸识别准确性或嵌入相似度。
一个评分能对换脸提供商进行排名吗?
不能。一个站得住脚的比较需要共享输入、重复输出、多位评审员、受控查看条件和统计报告。
为什么照片中排除时间稳定性?
静态图像没有帧序列。照片模式将六个适用标准从 90 基础权重分归一化为 100 分。
我可以重复使用该评分标准吗?
是的。已发布的 JSON 和空白 CSV 使用 CC BY 4.0 许可,并包含所需的署名声明和可下载的 BibTeX 记录。
FID 能衡量单个换脸输出吗?
不能。FID 比较生成图像集和参考图像集的分布。单张图像不是分布。
身份应与源图像还是目标图像比较?
身份检索和相似度通常将输出与源图像比较。姿态和表情保留通常将输出与目标图像比较。
CASIA FaceSwapping、IDBench-V 和 CanonSwap 的值可以直接比较吗?
不能。它们的配对构建、挑战切片、评估器、特征提取器、帧或音频窗口、预处理和聚合方式不同。在比较数值前,需重现一个共享协议。
开始换脸
适用于获准照片、批量、合照映射、视频和 GIF 工作流的浏览器 AI 换脸。