主页

【自用中译】开发自定义vlabeler标注器

开发自定义标注器 标注器(labeler) 是一组配置文件与脚本,针对特定标注场景定义应用的多项行为。 本文档将引导你为 vLabeler 开发自定义标注器。 本文涵盖以下主题: 理解 vLabeler 项目 标注器结构 标注器定义 标注器内脚本编写 构建项目 属性读取器 属性写入器 解析原始标签 写入原始标签 注入参数值 其他说明 理解 vLabeler 项目 开始前,需要先了解 vLabeler 的项目结构基础知识。 条目(Entry) 条目(entry) 是 vLabeler 内最小数据单元,代表一段带起始时刻和时长的音频数据。 大多数歌声合成软件都使...

阅读更多

【自用中译】开发 vLabeler 插件

开发 vLabeler 插件 本文档介绍 vLabeler 的插件开发流程。若插件规范无法满足需求,欢迎提交问题或功能需求。 概述 vLabeler 当前支持两类插件: 宏插件(Macro plugins):在项目编辑阶段执行,多用于条目批量编辑。 模板插件(Template plugins):新建项目时执行,主要用于生成一批待编辑条目。 两类插件结构设计一致,但执行上下文不同,因此输入、输出存在差异。 本文涵盖以下内容: 插件文件结构 插件定义 参数定义 插件脚本编写指南 编写模板生成脚本 编写批量编辑(宏)脚本 其他说明 插件文件结构 一个 vLa...

阅读更多

【中译】无人在意的 RAXXER 的“Vocaloid 数据库文档”没用附加内容

原文地址 你好! 我是 RAXXER,也可以叫我 Razer 或 Crazer。这篇文章会介绍一些可以为声库做的额外小技巧。 在继续往下看之前,强烈建议先去阅读 #tools-and-utilities 频道里的声库制作指南。 无论如何,这份文档都不会消失。需要帮助的话,请在 Discord 上联系我:razer_rhela EpR 估计 EpR可以指 Excitation Plus Resonances(激励加共振),或者Estimated Pitch Range(估计音高范围),这里我们取后者。如果你熟悉 RVC,可以把它当成是索引文件。它不是必须的,但确实能明显提升声库的音质。 EpR 背后的原理我不精通,但我可以教该怎么设置它! 对比有无 EpR...

阅读更多

一些激活函数的化简

尝试通过数学公式的化简,避免一些不必要的计算,提高神经网络激活函数的计算性能。 已知tanh函数:$\tanh(x) = \frac{e^x - e^{-x}}{e^x + e^{-x}}$ 在计算时需要计算两次指数函数 $e^x$ 和 $e^{-x}$ ,在计算上会比较麻烦。 通过将分式的分子分母同乘 $e^x$ ,可得:$\tanh(x) = \frac{e^{2x} - 1}{e^{2x} + 1}$ 让分子通过[+1-1]来凑出分母的表达式,即:$\tanh(x) = \frac{(e^{2x} + 1) - 1 - 1}{e^{2x} + 1}$ 化简得:$\tanh(x) = 1 - \frac{2}{e^{2x} + 1}$ 两者对比如下: 现在将其他包含tanh函数...

阅读更多

【研究】DYN和BRI

准备 Python及库若干 Vocaloid导出的文件:原始音符、DYN/BRI分别从127降到0和从0升到127的音频文件 思路 Vocaloid中每个音符的响度并不是固定的。试图通过将参数变化的音频与原始音频作差来抵消该分量。同时,元音头的重音和元音尾的渐弱也会造成一部分影响,试图通过将127~0的曲线反向,并与0~127的曲线取平均来抵消此部分影响(注:没用)。 操作 获得曲线 import matplotlib.pyplot as plt import parselmouth as pm import numpy as np plt.figure(figsize=(12,6)) org=pm.Sound("E:\桌面\Original.wav").to_intens...

阅读更多

【吐槽】Vocaloid的不足之处

混乱的发展路线 Vocaloid的软件更新速度相对来说比较缓慢,平均4年迭代一个大版本。但除了V1和V2、V4和V5之间的更新较大外,其他版本之间的更新对已经熟练使用的用户而言,仅仅是功能更新,不需要额外的学习成本。 但前提也仅仅限于熟练使用的用户。2014年底发布的V4,其界面相对于2007年初发布的V2而言,并没有太大的变化。虽然在那时,与为数不多的竞品UTAU和Cevio相比已经算好的了,但相较同期的Photoshop CC 2014、Office 2013而言,它们的设计语言则显得过于落后了。 在V4到V5的这段时间内,Sharpkey等新兴引擎引入了钢琴窗画音高线等便利功能,以及基于统计或机器学习改善合成质量、减少声库大小的革新。其中,最广受好评的便是Synthesiz...

阅读更多

【研究】SynthV jsm.data的解码与转换

原内容写于24/4/10,26/8/17取得进展后重写。 起源 打开Synthesizer V的安装目录,除了软件本体、配置文件和字体文件夹之外,就是clf-data文件夹了。打开这个文件夹,在里头可以看到许多文本文件,包括罗列音素的[语言]-[音素格式]-phones.txt、提供转换的[语言]-[转换内容]-dict.txt,以及包括cmudict-07b.txt等在内的各类字典等。 除了文本文件之外,无法直接阅读的[语言]-[音素格式]-jsm.data就是最为神秘的文件了。如果直接使用记事本打开,会发现文件是一堆乱码,无法直接阅读。但中间又夹杂着一些看上去像是音素的字母,前后两者非常相似,似乎是某种和音素有关的键值对。再加上当时SV0相比于VOCALOID在音素上的组合...

阅读更多

浅浅试了一下RecStar

最近有录声库的需求 于是借此机会尝试了一下新的录音器RecStar 顺便和OREMO做一下对比 非教程向 但要是能帮上忙更好 RecStar和vLabeler一样,是UTAU古早工具链的一个进化版(…?)目前是出到0.6.0了(昨天刚出的,2024.1.31)迭代还蛮快速的(所以不保证未来会不会大改) 先来321上链接:https://github.com/sdercolin/recstar/releases/ (除了桌面版还有移动版 Github登不上去的话可以参考这里 这里用的是Windows版 移动版我没试过) 首先说一下这个东西怎么用吧。整个界面是比OREMO要现代化不少的,我这边打开的时候加载可能有点慢(所以双击一回就行不然会打开好几个),进门先是一个最近使用的...

阅读更多

记录无聊的咸鱼生活.