KaniTTS2 — 3GB VRAMでボイスクローニング可能なオープンソースTTSモデル
4億パラメータの軽量TTSモデルKaniTTS2がオープンソースで公開されました。3GB VRAMのみでゼロショットボイスクローニングが可能で、事前学習コードも完全公開。MOSスコアや音声品質の評価結果とともに、ローカルAI環境での実用的な活用可能性を詳しく解説します。
archive
356 · ページ 20
4億パラメータの軽量TTSモデルKaniTTS2がオープンソースで公開されました。3GB VRAMのみでゼロショットボイスクローニングが可能で、事前学習コードも完全公開。MOSスコアや音声品質の評価結果とともに、ローカルAI環境での実用的な活用可能性を詳しく解説します。
GPUなしCPUのみで1.2時間、1,360万パラメータの言語モデルを訓練したFlashLM v3を分析します。乗算を排した三値重みによるMatMul-Freeアーキテクチャの原理とメモリ・省エネ効果、エッジAIや低コスト学習への示唆までを整理しました。
GitHubで6万以上のリポジトリが使うAGENTS.mdは本当に効果があるのか。ETH Zürichの初の実証論文は、LLM生成ファイルが成功率を3%下げ、開発者作成ファイルも4%向上にとどまり、推論コストは20%以上増えたと明らかにした。その結果と原因を分析する。
AIエージェントのスキル自動生成が実際には役に立たないことを実証したSkillsBench研究を解説。7,308トラジェクトリで自己生成スキルの効果はゼロでした。
270Mパラメータの超小型モデルFunctionGemmaをファインチューニングし、10-39%から90-97%のtool calling精度を達成した事例を分析します。スケーリング法則だけが答えではない証拠です。
OpenRouter週間利用ランキングTOP5のうち4つがオープンソースモデル(Qwen3-Coder、DeepSeek R2、MiniMax M2.5等)。プロプラモデル優位の終焉とオープンソースが実利用で選ばれる理由を分析します。
標準ベンチマークでトップクラスのQwen 3.5が、自販機経営シミュレーションVending-Bench 2で破産判定。ベンチマーク偏重がもたらすAI評価の盲点を解説します。
Claude Codeをローカルモデルで実行する際に発生する全プロンプト再処理問題の原因と解決策を分析します。KVキャッシュ無効化の仕組みと開発者ツール設計の教訓を解説します。
Heretic 1.2がリリース。4bit量子化でVRAM使用量を最大70%削減し、MPOAで高品質なアブリテレーションを実現。ローカルLLM運用コスト削減の最新手法を解説します。
AIモデルの学習コストが毎年40%ずつ下落しているというKarpathyの分析。ハードウェア進化、アルゴリズム効率化、データパイプライン最適化など構造的要因と業界への影響を解説します。
80Bパラメータのコーディング特化AIモデルを8GB VRAM消費者GPUで実行する量子化・レイジーローディング技法を解析します。ローカルLLMコーディングの実用性と限界を探ります。
Claude、Codex、Gemini計6体が並列でRust SQLiteクローン19,000行を実装。マルチエージェント分業と調整コストの現実を分析します。