跳转到内容

1.5 智能

在抽象化的 provider 接口之后加入 AI 驱动的剪辑工作流,让引擎保持 provider 中立——隐私敏感处端上执行,质量优先处可切换云端。

#条目优先级规模说明
1.5-1ASR 字幕生成P0L端上(WASM whisper 一类)和云端 provider 抽象两种方式的语音转文字,带时间轴对齐、置信度和可编辑性。供给 1.2 的字幕轨。
1.5-2人像分割P1L用于背景替换和人物成层的人像抠图,基于 WebGPU/shader 管线。
1.5-3智能剪辑建议P2L基于场景/节拍/静音分析给出粗剪建议并自动组装,依托 1.2 分析管线。
1.5-4自动调色建议P2M内容分析加风格化 LUT 推荐。
1.5-5TTS 旁白P2M文本转语音作为时间线节点。
1.5-6素材语义检索P2Lembedding 索引和对素材库的自然语言搜索。
  • 每个智能功能都作为 provider 接口暴露,且至少有一个参考实现;引擎绝不依赖单一模型厂商。
  • ASR 输出以经过校验的字幕实体落地,带置信度元数据并支持手动修正。
  • 端上路径遵守资源预算;云端路径沿用现有远程协议的安全模型(content-addressed assets、ephemeral authorization)。
  • 每个 provider 的隐私、许可和数据留存约束都有文档。
  • 依赖智能形态决策(端上 vs 云端),以及 1.2 分析管线和 1.1 WebGPU 等级。
  • 模型大小与 1.3 包体积预算冲突;端上模型需要按需加载路径。
  • 分割质量必须用参考/golden 评估覆盖,而不是凭印象。