0.17
TTS(音声合成)に関するQ&A
Q:なぜTTSモデルを変更したのですか?
A:公式のQwen3TTSモデルはサイズが大きく、単体で4GB、限界まで圧縮しても7GBになります。
Q:VoxCPM2の公式ページを確認したところ、CUDAに対応していると知りました。なぜ本ソフトでは使用されていないのですか?
A:公式モデルも同じく4GBです。サードパーティが最適化したモデルは依存ファイルを含めて約3.4GBで、音質は公式とほとんど変わりません。
Q:なぜプログラムのサイズを縮小しようとしているのですか?
A:海外のユーザーが中国のクラウドストレージからダウンロードする際に速度が遅いため、インストーラーをできるだけ圧縮しています。唯一のデメリットとして、OneDrive では最新バージョンしか入手できないことです。
Q:Qwen3TTS と VoxCPM2 の違いは何でしょうか?
A:両者はほぼ同様ですが、Qwen3TTS は使用感が向上しており生成速度も高速です。一方、VoxCPM2 は多くの言語に対応していますが、発音がやや不自然になる場合があります。
RVC(音声変換)に関するQ&A
Q:なぜRVCはDirectMLバージョンのみを提供しているのですか?
A:CUDAバージョンはNVIDIA GPUにしか対応していません。DirectMLはWindows 10/11でDirectX 12に対応していればハードウェアアクセラレーションが利用できるため、汎用バージョンを優先して作成しました。CUDAバージョンをご希望の場合は、お問い合わせいただければ、状況に応じて保守を継続します。
ソフトウェアに関するQ&A
Q:以前の2つのベータバージョンはなぜ削除されたのですか?
A:旧バージョンはCPUモードのみに対応しており、かつサイズが非常に大きかったため削除しました。(信じられない場合は、単にクラウド容量を節約したかったと思ってください。)
バージョン0.15は引き続き残します。これはQwen3TTS公式のSafetensorsモデルを使用した最後のバージョンだからです。
一部のユーザーは、最適化モデルではなく「オリジナルの」合成効果を求めるかもしれません。
ただし、このバージョンの音声は公式とほぼ同じであるため、引き続き公式版の利用を優先して推奨します。ストレージ容量が足りない場合はこのヒントを無視してください。
公式のSafetensorsモデルは今後更新されません。
Q:プログラムサイズを小さくしたいのであれば、ユーザー自身にTTSコアをダウンロードさせるのはなぜですか?
A:すぐに使える体験が最良だからです。
Q: AI とのチャット履歴や API キーが漏洩しないか心配です。
A: チャット履歴と API キーは暗号化されています。ただし、暗号化の仕組みは GitHub でオープンソース化しているため、ダウンロードする際は必ず公式バージョンをご利用いただき、出所不明なものは使用しないでくださ
その他の質問
Q:このソフトウェアを他のプラットフォームで転載・公開してもいいですか?
A:転載・公開は可能です。転載する際は、キャラクター利用ガイドと利用規約(Voiceger:Zundamon)のすべての要件を遵守してください。違法なダウンロードリンクの掲載は禁止です。
転載にあたって私の許諾は不要ですが、公開時には本プロジェクトのURLおよび作者情報を記載してください。できれば両方を明記していただけると助かります。
Q:なぜVoicegerを二次修正しようと思ったのですか?
A:公式版はシンプルで使いやすいですが、UIの見た目は普通で、中国語ローカライズが用意されていません。私自身は英語が読めても、すべてのユーザーが読めるわけではないため、これらの不足を補うために二次修正を行いました。
Q:ご提供いただいたシステムプロンプトを転載・再利用してもよろしいですか? A:はい、構いません。プロンプトをご利用になる際は、キャラクター利用ガイドおよび利用規約(Voiceger:ずんだもん)の全ての要件を遵守し、出典を明記してください。