【自用中译】开发自定义vlabeler标注器
开发自定义标注器
标注器(labeler) 是一组配置文件与脚本,针对特定标注场景定义应用的多项行为。
本文档将引导你为 vLabeler 开发自定义标注器。
本文涵盖以下主题:
理解 vLabeler 项目
标注器结构
标注器定义
标注器内脚本编写
构建项目
属性读取器
属性写入器
解析原始标签
写入原始标签
注入参数值
其他说明
理解 vLabeler 项目
开始前,需要先了解 vLabeler 的项目结构基础知识。
条目(Entry)
条目(entry) 是 vLabeler 内最小数据单元,代表一段带起始时刻和时长的音频数据。
大多数歌声合成软件都使...
【自用中译】开发 vLabeler 插件
开发 vLabeler 插件
本文档介绍 vLabeler 的插件开发流程。若插件规范无法满足需求,欢迎提交问题或功能需求。
概述
vLabeler 当前支持两类插件:
宏插件(Macro plugins):在项目编辑阶段执行,多用于条目批量编辑。
模板插件(Template plugins):新建项目时执行,主要用于生成一批待编辑条目。
两类插件结构设计一致,但执行上下文不同,因此输入、输出存在差异。
本文涵盖以下内容:
插件文件结构
插件定义
参数定义
插件脚本编写指南
编写模板生成脚本
编写批量编辑(宏)脚本
其他说明
插件文件结构
一个 vLa...

【中译】无人在意的 RAXXER 的“Vocaloid 数据库文档”没用附加内容
原文地址
你好! 我是 RAXXER,也可以叫我 Razer 或 Crazer。这篇文章会介绍一些可以为声库做的额外小技巧。
在继续往下看之前,强烈建议先去阅读 #tools-and-utilities 频道里的声库制作指南。
无论如何,这份文档都不会消失。需要帮助的话,请在 Discord 上联系我:razer_rhela
EpR 估计
EpR可以指 Excitation Plus Resonances(激励加共振),或者Estimated Pitch Range(估计音高范围),这里我们取后者。如果你熟悉 RVC,可以把它当成是索引文件。它不是必须的,但确实能明显提升声库的音质。
EpR 背后的原理我不精通,但我可以教该怎么设置它!
对比有无 EpR...
一些激活函数的化简
尝试通过数学公式的化简,避免一些不必要的计算,提高神经网络激活函数的计算性能。
已知tanh函数:$\tanh(x) = \frac{e^x - e^{-x}}{e^x + e^{-x}}$
在计算时需要计算两次指数函数 $e^x$ 和 $e^{-x}$ ,在计算上会比较麻烦。
通过将分式的分子分母同乘 $e^x$ ,可得:$\tanh(x) = \frac{e^{2x} - 1}{e^{2x} + 1}$
让分子通过[+1-1]来凑出分母的表达式,即:$\tanh(x) = \frac{(e^{2x} + 1) - 1 - 1}{e^{2x} + 1}$
化简得:$\tanh(x) = 1 - \frac{2}{e^{2x} + 1}$
两者对比如下:
现在将其他包含tanh函数...

【研究】DYN和BRI
准备
Python及库若干
Vocaloid导出的文件:原始音符、DYN/BRI分别从127降到0和从0升到127的音频文件
思路
Vocaloid中每个音符的响度并不是固定的。试图通过将参数变化的音频与原始音频作差来抵消该分量。同时,元音头的重音和元音尾的渐弱也会造成一部分影响,试图通过将127~0的曲线反向,并与0~127的曲线取平均来抵消此部分影响(注:没用)。
操作
获得曲线
import matplotlib.pyplot as plt
import parselmouth as pm
import numpy as np
plt.figure(figsize=(12,6))
org=pm.Sound("E:\桌面\Original.wav").to_intens...
【吐槽】Vocaloid的不足之处
混乱的发展路线
Vocaloid的软件更新速度相对来说比较缓慢,平均4年迭代一个大版本。但除了V1和V2、V4和V5之间的更新较大外,其他版本之间的更新对已经熟练使用的用户而言,仅仅是功能更新,不需要额外的学习成本。
但前提也仅仅限于熟练使用的用户。2014年底发布的V4,其界面相对于2007年初发布的V2而言,并没有太大的变化。虽然在那时,与为数不多的竞品UTAU和Cevio相比已经算好的了,但相较同期的Photoshop CC 2014、Office 2013而言,它们的设计语言则显得过于落后了。
在V4到V5的这段时间内,Sharpkey等新兴引擎引入了钢琴窗画音高线等便利功能,以及基于统计或机器学习改善合成质量、减少声库大小的革新。其中,最广受好评的便是Synthesiz...
【研究】SynthV jsm.data的解码与转换
原内容写于24/4/10,26/8/17取得进展后重写。
起源
打开Synthesizer V的安装目录,除了软件本体、配置文件和字体文件夹之外,就是clf-data文件夹了。打开这个文件夹,在里头可以看到许多文本文件,包括罗列音素的[语言]-[音素格式]-phones.txt、提供转换的[语言]-[转换内容]-dict.txt,以及包括cmudict-07b.txt等在内的各类字典等。
除了文本文件之外,无法直接阅读的[语言]-[音素格式]-jsm.data就是最为神秘的文件了。如果直接使用记事本打开,会发现文件是一堆乱码,无法直接阅读。但中间又夹杂着一些看上去像是音素的字母,前后两者非常相似,似乎是某种和音素有关的键值对。再加上当时SV0相比于VOCALOID在音素上的组合...

浅浅试了一下RecStar
最近有录声库的需求 于是借此机会尝试了一下新的录音器RecStar 顺便和OREMO做一下对比
非教程向 但要是能帮上忙更好
RecStar和vLabeler一样,是UTAU古早工具链的一个进化版(…?)目前是出到0.6.0了(昨天刚出的,2024.1.31)迭代还蛮快速的(所以不保证未来会不会大改)
先来321上链接:https://github.com/sdercolin/recstar/releases/
(除了桌面版还有移动版 Github登不上去的话可以参考这里 这里用的是Windows版 移动版我没试过)
首先说一下这个东西怎么用吧。整个界面是比OREMO要现代化不少的,我这边打开的时候加载可能有点慢(所以双击一回就行不然会打开好几个),进门先是一个最近使用的...
共计 10 篇文章,2 页。