样本音频:
http://devv.cc:8999/mp3/从仲树看知识囤积癖_%23仲树_%23原生家庭_%23东亚文化.mp3
下载命令:
curl -O http://devv.cc:8999/mp3/从仲树看知识囤积癖_%23仲树_%23原生家庭_%23东亚文化.mp3
funasr 1.4.14
红色为字幕句间隙少于100ms的,按说这么小的间隙,没有充分的理由或特殊权重,是没有理由硬断的,它不识别 ”汉娜*阿伦特“ 和 “欧叶尼*葛郎台” 也就罢了。是否这些地方刚好位于分批或分段”喂料“ 的边界上?或者说:在这种特殊的字幕生成(transcription)工作模式下,喂入边界的方式是否就不应该存在?技术上应该有办法避开简陋的固定时长硬截段的方式吧?
图中的字幕起-止时间后的“60”是当前末与下句起始时间之间的gap时长。

样本音频:
http://devv.cc:8999/mp3/从仲树看知识囤积癖_%23仲树_%23原生家庭_%23东亚文化.mp3
下载命令:
curl -O http://devv.cc:8999/mp3/从仲树看知识囤积癖_%23仲树_%23原生家庭_%23东亚文化.mp3
funasr 1.4.14
红色为字幕句间隙少于100ms的,按说这么小的间隙,没有充分的理由或特殊权重,是没有理由硬断的,它不识别 ”汉娜*阿伦特“ 和 “欧叶尼*葛郎台” 也就罢了。是否这些地方刚好位于分批或分段”喂料“ 的边界上?或者说:在这种特殊的字幕生成(transcription)工作模式下,喂入边界的方式是否就不应该存在?技术上应该有办法避开简陋的固定时长硬截段的方式吧?
图中的字幕起-止时间后的“60”是当前末与下句起始时间之间的gap时长。