要点:屏幕上每个像素都是原画,加上会相加的位移场。
一张纹理 13 层 —— 3 层呼吸 + 8 个表情基 + 2 个枢纽过渡,共 247 KB。
权重向量就是全部动画状态,所以状态数是相加的不是相乘的。
唯一的例外是张开的嘴:那片暗腔画布上不存在,形变造不出来。
会说话:麦克风 → Silero VAD 断句 → SenseVoice 转写 →
DeepSeek(1887 的 Vincent)→ Kokoro 逐句合成 → 口型。除 LLM 外全部自建。
没人说话时他会自言自语。
表情基怎么来的:让 gpt-image-2 把原画变成一张同构图的真人替身照片,
再让替身做出每个表情,用面部关键点把替身 TPS 配准到原画
(配准后偏差 7.2 px),两张配准图之间的光流就是该表情的位移场。
模型画真人是它的主场;而且模型的像素一个都不上屏,只有位移场上屏。
实测(每个基单独拉到 1.0 时的像素变化:左脸颊 / 右脸颊 / 胸口 / 背景):
pitch 35.0 / 24.2 / 0 / 0;yaw 34.8 / 24.3 / 0 / 0;
brow_furrow 19.0 / 9.9 / 0 / 0;jaw_open 18.6 / 15.0 / 0.3 / 0。
胸口和背景都不再跟着动。
还没做:枢纽过渡(切换暂时关闭,H3 FL2VA 在 Modal 上测)、
嘴部开口条带 + viseme 映射、签名时刻、语音(ASR / TTS / LLM)、
图集加密与签名 URL。