论文阅读笔记:Training-free Detection of Generated Videos via Spatial-Temporal Likelihood

原始地址:https://arxiv.org/abs/2603.15026 代码实现:https://github.com/OmerBenHayun/STALL 此论文实现了 training-free 的 AI 视频生成检测算法。论文使用了大量数学算法,因此写下笔记记录。 论文大致原理是对真实视频计算出一个空间分布,而生成视频不符合这个空间分布,从而实现对生成视频的识别。 真实视频空间分布计算 首先利用 DINOv3 模型对所有真实视频帧执行嵌入,每个视频 $V_i$ 得到一个帧序列: $$ E_i=\{e_1, e_2, ..., e_t\} $$ DINOv3 DINOv3 模型是图像理解模型,因此得到的嵌入对原始帧独立处理的产物,不同帧之间不携带上下文信息。 视频帧表征空间分布计算 这一分支主要目的是判别视频帧有多大程度满足真实视频的分布。 论文对 $N$ 个帧序列…