1.5 智能
在抽象化的 provider 接口之后加入 AI 驱动的剪辑工作流,让引擎保持 provider 中立——隐私敏感处端上执行,质量优先处可切换云端。
| # | 条目 | 优先级 | 规模 | 说明 |
|---|---|---|---|---|
| 1.5-1 | ASR 字幕生成 | P0 | L | 端上(WASM whisper 一类)和云端 provider 抽象两种方式的语音转文字,带时间轴对齐、置信度和可编辑性。供给 1.2 的字幕轨。 |
| 1.5-2 | 人像分割 | P1 | L | 用于背景替换和人物成层的人像抠图,基于 WebGPU/shader 管线。 |
| 1.5-3 | 智能剪辑建议 | P2 | L | 基于场景/节拍/静音分析给出粗剪建议并自动组装,依托 1.2 分析管线。 |
| 1.5-4 | 自动调色建议 | P2 | M | 内容分析加风格化 LUT 推荐。 |
| 1.5-5 | TTS 旁白 | P2 | M | 文本转语音作为时间线节点。 |
| 1.5-6 | 素材语义检索 | P2 | L | embedding 索引和对素材库的自然语言搜索。 |
- 每个智能功能都作为 provider 接口暴露,且至少有一个参考实现;引擎绝不依赖单一模型厂商。
- ASR 输出以经过校验的字幕实体落地,带置信度元数据并支持手动修正。
- 端上路径遵守资源预算;云端路径沿用现有远程协议的安全模型(content-addressed assets、ephemeral authorization)。
- 每个 provider 的隐私、许可和数据留存约束都有文档。
- 依赖智能形态决策(端上 vs 云端),以及 1.2 分析管线和 1.1 WebGPU 等级。
- 模型大小与 1.3 包体积预算冲突;端上模型需要按需加载路径。
- 分割质量必须用参考/golden 评估覆盖,而不是凭印象。