ARCHIVE
아카이브
기존에 공개한 글을 원래 주소 그대로 보관합니다.
과거의 글에는 작성 당시의 기술과 관점이 담겨 있습니다.
356개 글 · 8 / 12 페이지
· JA
GitHub Agentic Workflows — CI/CDにAIエージェントが参加
GitHub Agentic Workflowsの技術プレビューを分析します。MarkdownでAIエージェントが自動化を定義し、継続的なAIパラダイムで課題分類・コード生成・テスト作成を実現します。
· JA
MIT TLT: 推論LLM訓練の速度を2倍に加速させる適応型ドラフター
MITが発表したTLT技術は、遊休GPUを活用して推論LLMのRL訓練を70~210%加速します。適応型ドラフターとロールアウトエンジンの仕組みを解析します。
· JA
Claude Code Remote Control 完全ガイド — セットアップからモバイル遠隔操作まで
Claude Code Remote Controlの設定方法と活用法を解説します。デスクトップで始めたタスクをモバイルからモニタリング・操作するワークフローを実例とともに紹介します。
· JA
OpenClawのモデルをOpenAI Codexに切り替える — ToS混乱後の実践ガイド
Claude・GeminiのToS変更後、OpenClawユーザー向けのOpenAI Codex移行ガイド。バックアップからモデル設定、エージェント別構成まで一気に解説します。
· JA
塩を信じるな — 多言語LLM安全性とガードレールの盲点
多言語環境でLLMガードレールが無力化される実態を分析します。英語以外の言語で安全性検証が失敗する構造的問題と実務的な対応策を提示します。
· JA
GGML/llama.cppがHugging Faceに合流 — ローカルAIインフラの構造的転換点
ggml.aiチームがHugging Faceに合流し、llama.cppの長期的な持続可能性を確保します。ローカルAI推論エコシステムの構造的変化と技術的意義を分析します。
· JA
ASIC推論チップでLlama 3.1 8Bが16,000 tok/s — GPU不要のAI推論時代
ASIC専用チップのスタートアップTaalasがGPUなしでLlama 3.1 8Bを16,000 tok/sで駆動。GPU依存からの脱却と推論コスト構造の激変を分析します。
· JA
Consistency Diffusion言語モデル:ARの14倍速で品質損失ゼロ
Together AIが発表したCDLMは拡散型言語モデルの推論速度を最大14倍に向上させ、品質損失を最小化します。ブロック単位の並列生成とKVキャッシュの組み合わせが鍵です。
· JA
Gemini 3.1 Pro発表 — Google次世代モデルの性能分析とClaude比較
GoogleがGemini 3.1 Proを発表。ARC-AGI-2で77.1%を達成し推論能力が2倍以上向上。性能分析、Claudeとの比較、マルチモーダル進化を解説します。
· JA
llama.cppにIQ*_K/IQ*_KS量子化が統合 — ik_llama.cppの成果がメインラインへ
ik_llama.cppで開発されたIQ系量子化手法がllama.cpp本体にマージ。IQ2_K〜IQ4_KSの精度向上とローカルLLM推論効率化の技術的背景を解説します。
· JA
Qwen3 Coder Next llama.cppグラフ最適化 — 最大38%の推論高速化
ggerganovがllama.cppのコンピュートグラフを再構成し、Qwen3 Coder Next 80Bモデルの推論速度を最大38%向上させた最適化手法とベンチマーク結果を解析します。
· JA
DDR5 RDIMM vs RTX 3090 — ローカルLLMのGB単価が逆転した転換点
DDR5 RDIMMのGB単価が3090のVRAMを下回り、ローカルLLMハードウェア選択の転換点が到来しました。CPU推論とGPU推論のコスト構造を分析します。
· JA
Devstral Small 2 24BとQwen3 Coder 30B — 小型コーディングモデル時代の到来
Mistral Devstral Small 2 24BとQwen3 Coder 30Bが同時期に登場。Raspberry Piでも動く小型コーディングモデルの比較分析とローカルAIコーディングの未来を解説します。
· JA
Kitten TTS V0.8 — 25MB未満でSOTA達成の超小型TTSモデル完全解説
14Mパラメータ・25MB未満でクラウドTTS品質を実現するKitten TTS V0.8を徹底解説。エッジデバイス展開の可能性とローカル音声AI最新トレンドを分析します。
· JA
30ドルラジオ+ローカルAI=インターネット不要スマートホーム — エッジAIの実用例
Mac miniと30ドルのLoRaラジオだけで、インターネットなしに音声制御とスマートホーム操作を実現した実践事例を分析します。ローカルAI×IoTの具体的な実装とコストを解説します。
· JA
BarraCUDA — CUDAコードをAMD GPUで動かすオープンソースコンパイラ
CUDAコードをLLVM不要でAMD GPU用機械語に直接コンパイルするオープンソースコンパイラBarraCUDAを徹底解説します。15,000行のC99で実装されたアーキテクチャ詳細、対応CUDA機能の完全一覧、そしてGPUベンダー独占から脱却するための実践的戦略を、実コード例とともに詳しく紹介します。
· JA
Claude Sonnet 4.6リリース — Anthropicの中間モデル戦略と性能分析
Claude Sonnet 4.6のリリースを機にAnthropicのモデルバージョン戦略を徹底分析。Opus・Sonnet・Haikuのラインナップ再編から性能ベンチマーク比較、APIコスト効率の変化まで整理し、開発者が注目すべきアップグレードポイントを詳解します。
· JA
DeepSeek V4リリース間近 — 中国AIの次世代モデル競争が加速
DeepSeek V4リリースが近づく中、Qwen3.5やGLM-5など中国AI各社のモデルラッシュが続いています。DeepSeek-R1比の推論性能向上とコーディングベンチマーク改善点を分析し、オープンソースLLMがGPT-4級性能に迫る中でグローバルAI競争の構図がいかに変化しているか解説します。
· JA
KaniTTS2 — 3GB VRAMでボイスクローニング可能なオープンソースTTSモデル
4億パラメータの軽量TTSモデルKaniTTS2がオープンソースで公開されました。3GB VRAMのみでゼロショットボイスクローニングが可能で、事前学習コードも完全公開。MOSスコアや音声品質の評価結果とともに、ローカルAI環境での実用的な活用可能性を詳しく解説します。
· JA
CPUだけで1.2時間でLLM訓練 — MatMul-Freeアーキテクチャの可能性
GPUなしCPUのみで1.2時間、1,360万パラメータの言語モデルを訓練したFlashLM v3を分析します。乗算を排した三値重みによるMatMul-Freeアーキテクチャの原理とメモリ・省エネ効果、エッジAIや低コスト学習への示唆までを整理しました。
· JA
AGENTS.mdは本当に効果的か?初の実証論文が明かした意外な結果
GitHubで6万以上のリポジトリが使うAGENTS.mdは本当に効果があるのか。ETH Zürichの初の実証論文は、LLM生成ファイルが成功率を3%下げ、開発者作成ファイルも4%向上にとどまり、推論コストは20%以上増えたと明らかにした。その結果と原因を分析する。
· JA
AIが自己生成したスキルは無意味 — LLMの自己改善神話を覆す実証研究
AIエージェントのスキル自動生成が実際には役に立たないことを実証したSkillsBench研究を解説。7,308トラジェクトリで自己生成スキルの効果はゼロでした。
· JA
FunctionGemma 270M — 超小型モデルでマルチターンtool calling精度90-97%達成
270Mパラメータの超小型モデルFunctionGemmaをファインチューニングし、10-39%から90-97%のtool calling精度を達成した事例を分析します。スケーリング法則だけが答えではない証拠です。
· JA
OpenRouter週間TOP5の4つがオープンソース — プロプラモデル優位の終焉
OpenRouter週間利用ランキングTOP5のうち4つがオープンソースモデル(Qwen3-Coder、DeepSeek R2、MiniMax M2.5等)。プロプラモデル優位の終焉とオープンソースが実利用で選ばれる理由を分析します。
· JA
Qwen 3.5がVending-Bench 2で破産 — ベンチマーク偏重の落とし穴
標準ベンチマークでトップクラスのQwen 3.5が、自販機経営シミュレーションVending-Bench 2で破産判定。ベンチマーク偏重がもたらすAI評価の盲点を解説します。
· JA
Claude Codeをローカルモデルで動かすと全プロンプト再処理 — アーキテクチャの非効率性
Claude Codeをローカルモデルで実行する際に発生する全プロンプト再処理問題の原因と解決策を分析します。KVキャッシュ無効化の仕組みと開発者ツール設計の教訓を解説します。
· JA
Heretic 1.2 — 量子化でVRAM 70%削減とMPOA技術の全貌
Heretic 1.2がリリース。4bit量子化でVRAM使用量を最大70%削減し、MPOAで高品質なアブリテレーションを実現。ローカルLLM運用コスト削減の最新手法を解説します。
· JA
Karpathy「AI学習コストは年40%下落」— デフレーションが業界構造を変える
AIモデルの学習コストが毎年40%ずつ下落しているというKarpathyの分析。ハードウェア進化、アルゴリズム効率化、データパイプライン最適化など構造的要因と業界への影響を解説します。
· JA
Qwen3-Coder-Next 80Bを8GB VRAMで動かす方法 — 量子化テクニック解説
80Bパラメータのコーディング特化AIモデルを8GB VRAM消費者GPUで実行する量子化・レイジーローディング技法を解析します。ローカルLLMコーディングの実用性と限界を探ります。
· JA
AIスウォームでSQLiteクローンを構築 — マルチエージェント分業の現実
Claude、Codex、Gemini計6体が並列でRust SQLiteクローン19,000行を実装。マルチエージェント分業と調整コストの現実を分析します。