版本更新公告
本次版本属于较大规模功能升级,重点围绕制作诊断、PPT 兼容性、配音参数、字幕过滤以及配音时间轴微调进行了系统优化。
一、全新完整制作诊断日志
重新完善 run.log 日志体系,贯穿文档视频制作全生命周期
日志覆盖范围扩展至以下环节:
PPT 提取与输出目录
页面处理过程
TTS 配音角色、文本及执行状态
TTS 缓存 HIT / MISS
TTS 接口执行与音频生成
音频片段处理及合并
字幕生成与合并
FFmpeg 执行过程及错误
最终视频生成
异常堆栈和失败原因
原独立 xxx_final_build_failed_xxx.txt 错误文件的诊断职责已整合进统一日志
批量制作中每个文档均可独立导出制作日志
普通"文档转视频"页面新增独立日志导出入口
日志按钮重新设计为简洁 SVG 图标,无矩形背景,支持界面自适应缩放
二、PPT 横屏 / 竖屏提取兼容性改善
调整 PPT 页面尺寸处理逻辑,修复竖版 PPT 被强制按 16:9 横屏输出的问题
未指定固定输出比例时,尊重 PPT 自身页面尺寸:
横版 PPT → 横版输出
竖版 PPT → 竖版输出
用户明确指定比例 → 按用户参数执行
竖屏课件、手机视频课件等场景兼容性得到改善
三、新增 PPT 配音静音参数
新增两个配音节奏控制参数:
每 P 开场静音时长
控制每页 PPT 开始播放后到第一句配音开始之间的等待时间
默认 0 秒
可选值:0.5 / 1 / 1.2 / 1.5 ……
每个短句前静音时长
控制每个断句后的下一条短句在朗读前插入的静音时长
默认 0 秒
两个参数均同时应用于:
普通文档转视频
批量文档转视频
四、PPT 素材音量参数界面优化
整理基础处理参数区域布局,解决输入框间距过近、视觉混淆问题
参数名称统一,例如:PPT素材音量(%),使设置项与实际业务含义一致
五、新增"无条件过滤字典"
新增独立的文本过滤字典管理能力
用户可维护不应进入配音、也不应出现在字幕中的固定文本
过滤流程:PPT 提取配音文案后,先进行过滤处理
被过滤的内容:
不参与 TTS
不进入字幕
不进入后续配音文案
参数设置页面提供对应管理入口,支持增加、删除和维护过滤规则
六、配音时间轴微调功能大幅升级
时间轴播放头统一坐标系
修复红色播放标线与可拖动播放头因时间轴缩放产生位置偏差的问题
播放头和时间标尺使用同一套时间轴坐标计算
播放指示改为更醒目的橙色
优化刷新机制,播放移动更加连续流畅
修复动画 PPT 微调后重新合成失败
修复动画 PPT 拖动音频素材保存后重新合成出现 FFmpeg 报错(如 Stream specifier ... matches no streams)的问题
动画 PPT 的配音时间调整现在可正确参与重新合成
时间轴文本支持 \N 换行
音频素材文本中如存在 \N,时间轴显示时按换行语义处理,不再原样显示
七、音频片段支持独立音量调整
时间轴中每个音频素材可通过右键单独设置音量
内置常用值:0% / 25% / 50% / 75% / 100% / 125% / 150% / 200%
支持自定义范围:0% ~ 200%
100% = 原始音量
50% = 降低音量
150% = 提升至 1.5 倍
200% = 提升至 2 倍
保存并重新合成后,音量设置真正进入 FFmpeg 音频处理链路
超过 100% 增益时自动增加 limiter 保护,降低削波失真概率
取代此前"自动统一所有预览素材响度"方案,音量控制权交给用户
八、时间轴新增音频分割功能
时间轴工具栏新增橙色剪刀 SVG 图标
操作方式:
将橙色播放头移动到某个音频素材内部
点击剪刀
当前音频素材从播放头位置拆分为左右两个片段
示例:原始音频 A.wav(0~8 秒),在 3 秒处分割 → 左片段 0~3 秒,右片段 3~8 秒
非破坏性分割:
不真正切割原文件,不修改原始 TTS 音频
两个片段仍引用同一源文件,分别记录 SourceOffset 和 SourceDuration
最终重新合成时由 FFmpeg 按区间执行真实裁切
九、音频片段支持删除
音频素材右键菜单新增"删除此音频片段(不删除源文件)"
删除仅影响当前时间轴编辑状态
不会删除:
TTS 原始 WAV
外部音频素材
TTS 缓存
原始 PPT 文件
可先分割再删除不需要的部分,保存重新合成后最终视频只保留所需片段
十、分割后的音频可独立编辑
分割后的左右片段均可分别进行以下操作:
调整音量
修改倍速
调整句前静音
拖动时间位置
再次分割
删除
时间轴已从单纯"调整配音位置"升级为具备基础音频剪辑能力
十一、分割不会造成字幕重复
带字幕的语音片段分割后,两段继承原文本
重新生成字幕时,如检测到:
两段文本完全相同
时间连续
中间不存在人为间隔
程序自动将两段重新合并为一条连续字幕
因删除音频尾部或调整音量而进行的分割,不会导致视频中出现两次相同字幕闪烁
十二、时间轴片段选中状态重新设计
音频素材支持明确的"当前选中"状态
选中后显示:
橙色粗边框
浅橙色背景
深橙色文字
更明显的文字权重
选中高亮在拖动、缩放时间轴、修改音量、修改倍速后仍保持
执行分割后,新产生的右侧片段自动进入选中状态,方便继续删除或调整
十三、时间轴鼠标操作体验改善
鼠标移至音频素材上后,指针统一显示为手指形状,不再显示易造成误解的左右箭头
拖动功能保持不变:左右拖动音频素材本质上是调整该片段前的静音时间,从而改变其在时间轴中的开始位置
十四、微调窗口增加常驻"操作指南"
微调窗口左下角始终显示操作提示,无需自行摸索功能
指南内容包括:
单击音频片段可选中并高亮
左右拖动片段可增加或减少该段前的静音,从而调整开始位置
右键可修改倍速、音量或删除
将橙色播放头移动到片段内部后点击剪刀可分割
分割后的左右片段可分别继续调整或删除
动态状态信息仍保留在指南下方,用于提示当前操作结果
十五、pinyin.json 单英文字母纠音规则修复
修复单英文字母纠音规则易污染英文缩写、化学式的问题
过去配置如 {"N": "氮"} 时,程序执行普通文本替换,可能误伤 DNA、RNA、NVIDIA、NH3、N2、2N 等
现在对单个英文字母规则增加安全边界判断:
单个英文字母仅在前后都不是英文字母或数字时才执行发音纠正
中文、空格、标点、符号及字符串首尾均为合法边界
示例:
"N在木星大气中占比很大吗?" → 生效
"其实N的占比并不多,Now you kown?" → 独立 N 生效,Now 中的 N 不受影响
"Na是一个化学元素。" → 不影响 Na
"你们要记住 N 这个元素。" → 独立 N 生效
"人类的DNA非常强大。" → DNA 完全不受影响
NH3 / N2 / 2N / RNA / NVIDIA 均不会被误纠音
两个及以上字符的 pinyin.json 规则保持原有行为,不受本次修改影响
本次大版本升级总结
稳定性:完善全流程诊断日志、FFmpeg 错误捕获及批量任务执行机制
制作能力:时间轴新增选中、拖动、倍速、独立音量、分割、删除及非破坏性音频区间编辑
文本与语音准确性:新增过滤字典、配音静音参数,修复 pinyin.json 单英文字母纠音误伤英文缩写和化学式的问题
如果想了解更多穹想PPT转视频工具的历史版本更新记录,