Skip to content

proposal: 建立生图与视频模型的选型判据与实验规程 #465

Description

@johnnyzhang-eng

背景

Windup 的 2D 生成链路是:文生图出母版 → i2v 出一段视频 → 抽帧 → 抠图 → 脚线对齐 → 打包。这条链路上游是模型,下游全部是补救。母版与动作帧的质量上限由模型对该动作的理解决定,后处理只能修边角。

当前的模型选择是历史沿用而非测量结果:生图固定 gemini-2.5-flash-image,视频固定 kling-v2-5-turbo,时长在 ai_engine/strategy/concrete.py 硬编码为 5 秒。既有的质量判断分散在若干次单点实验里,彼此分母不同、不可复现,也无法预测下一个动作会怎么失败。

同时,主仓已经积累了一批可用的量化能力:成色落库(#322)、可数四问判官(#324)、站位偏离检测(#396)、尺度漂移补偿(#308)、抠图两模型并集(#403)。这些读数目前只服务于单个 PR 的验收,没有被组织成一套可复用的选型判据。

问题

  1. 判据不成体系。可算的读数只有若干条,其余靠人工目测,结论不可复现、换人换天会变。
  2. 缺少主排名指标。没有一个能把质量与成本合并的口径,导致「便宜」与「好用」无法比较。
  3. 候选集受限于已接入的端点。/v1/videos 只服务可灵,其余厂商在 FAL 队列面且 provider 已移除,直接横评会把「没接入」误判为「不值得选」。
  4. 时长口径未经验证。一次性动作(attack)在 5 秒内会出现后段冗余,可能触发出画与漂移判据,把动作设计问题记到模型头上。

方案

建立一套模型选型判据与实验规程,产出两张表:生图的「模型 × 画风」适配矩阵,和视频的模型排名。

判据分层

  • 硬闸口(纯算法,决定单帧废否):出画、死帧、多主体、站位漂移、尺度漂移、首帧偏移、时长与帧率履约。
  • clip 级闸口(决定该段能否交付):动作语义正确、循环接缝、步态相位、最小动量。
  • 连续读数(纯算法):分区动量、模糊度、帧间闪烁、身份一致度、角色像素高度、画风保真。
  • 语义题(判官):动作语义、凭空多物、画风相似、刚体守恒。
  • 运营指标:调用失败率、审核拒绝率、出片延迟、同输入方差。

主排名指标:单位成本可交付的动作序列数。主分析按 intention-to-treat 计,失败、审核拒绝与超时计入成本且记零产出;仅在成功样本上配对比较会产生幸存者偏差。

判官规程:只问可数的封闭问题;先以人工黄金集标定并公布判官与人的一致率,未标定的判官读数不入账;人与判官均只做配对比较,不做绝对打分。人工投入集中在标定一次与事后抽检,不参与每轮评测。

分期

  1. 仪器标定:用既有归档素材在盲验证集上冻结阈值,逐条给出 precision/recall 与人工复核的错例;估计方差并给出最小可检测效应。不产生调用成本。
  2. 时长探针:同模型同输入比较两档时长的可交付率与单价。
  3. 生图画风矩阵。
  4. 视频横评:候选限定为 /v1/videos 可达的可灵系,母版取自第 3 步产物,两期串联而非割裂。
  5. FAL 队列面哨兵样本,用于判断是否值得重建该 provider。

不包含

  • 不改动生产链路的默认模型与默认时长。本 Issue 只产出判据与结论,切换默认值另立 Issue。
  • 不重建 FAL 队列面 provider,只跑哨兵样本。
  • 不评价动作节奏。视频输出匀速,节奏由抽帧与引擎每帧时长决定,不属于模型能力。
  • 不覆盖三渲二路线。该路线多朝向为本地渲染,不参与按次计费的模型横评。

验收

  1. 判据清单落地为可执行的度量代码,每条硬闸口在盲验证集上有 precision/recall。
  2. 判官与人工标注的一致率被测量并公布。
  3. 产出生图「模型 × 画风」矩阵,每格给出通过率与置信区间。
  4. 产出视频模型排名,按主排名指标给出,并显式标注结论适用范围。
  5. 时长口径有实测依据,而非沿用默认值。
  6. 全部实验可由归档脚本从原始输入重跑出同一组读数。

Metadata

Metadata

Labels

proposal该 Issue 是一个产品提案

Type

Projects

No projects

Relationships

None yet

Development

No branches or pull requests

Issue actions