ARCHIVE
아카이브
기존에 공개한 글을 원래 주소 그대로 보관합니다.
과거의 글에는 작성 당시의 기술과 관점이 담겨 있습니다.
356개 글 · 8 / 12 페이지
· ZH
GitHub Agentic Workflows — AI代理加入CI/CD管道
分析GitHub Agentic Workflows技术预览。使用Markdown定义自动化,AI代理执行问题分类、代码审查、测试生成的Continuous AI范式。
· ZH
MIT TLT:用适应型草案模型将推理LLM训练速度提升2倍
MIT发布的TLT技术利用闲置GPU将推理LLM的强化学习训练加速70〜210%。分析适应型草案模型和生成引擎的工作机制。
· ZH
Claude Code Remote Control 完全指南 — 从设置到移动端远程控制
详解Claude Code Remote Control的设置方法和使用技巧。通过实战案例介绍如何从手机监控和控制桌面端的开发任务工作流。
· ZH
将OpenClaw切换到OpenAI Codex — ToS变更后的实战迁移指南
Claude和Gemini服务条款变更后,面向OpenClaw用户的OpenAI Codex迁移指南。从备份到模型切换、Agent配置,一文搞定。
· ZH
别信任盐 — 多语言LLM安全性与护栏的盲区
分析多语言环境中LLM护栏失效的现状。探讨英语以外语言中安全性验证失败的结构性问题,并提出实际对策。
· ZH
GGML/llama.cpp加入Hugging Face — 本地AI基础设施的结构性转折点
ggml.ai团队加入Hugging Face,确保llama.cpp的长期可持续发展。本文分析本地AI推理生态系统的结构性变化及技术意义。
· ZH
ASIC推理芯片让Llama 3.1 8B达到16,000 tok/s — 无GPU的AI推理时代
ASIC专用芯片初创公司Taalas在无GPU条件下以16,000 tok/s运行Llama 3.1 8B。分析摆脱GPU依赖的趋势与推理成本结构的剧变。
· ZH
Consistency Diffusion语言模型:比AR快14倍且零质量损失
Together AI发布的CDLM将扩散语言模型的推理速度提升最高14倍,同时将质量损失降至最低。块级并行生成与KV缓存的结合是关键突破。
· ZH
Gemini 3.1 Pro发布 — Google下一代模型性能分析与Claude对比
Google发布Gemini 3.1 Pro,在ARC-AGI-2上达到77.1%,推理性能提升2倍以上。本文分析其性能指标、与Claude的对比及多模态进化。
· ZH
llama.cpp合并IQ*_K/IQ*_KS量化 — ik_llama.cpp的成果进入主线
ik_llama.cpp开发的IQ系量化方法正式合并至llama.cpp主线。详解IQ2_K至IQ4_KS的精度提升与本地LLM推理效率优化的技术背景。
· ZH
Qwen3 Coder Next llama.cpp图级优化 — 最高38%推理加速
ggerganov重构llama.cpp计算图,使Qwen3 Coder Next 80B模型推理速度提升最高38%。详细解析优化技术与基准测试结果。
· ZH
DDR5 RDIMM vs RTX 3090 — 本地LLM每GB成本逆转的转折点
DDR5 RDIMM的每GB价格已低于RTX 3090的VRAM,标志着本地LLM硬件选择的转折点。本文分析CPU推理与GPU推理的成本结构。
· ZH
Devstral Small 2 24B与Qwen3 Coder 30B — 小型编码模型时代的开启
Mistral Devstral Small 2 24B和Qwen3 Coder 30B同时登场。可在Raspberry Pi上运行的小型编码模型对比分析及本地AI编码的未来展望。
· ZH
Kitten TTS V0.8 — 不到25MB实现SOTA的超小型TTS模型完全解析
深入分析14M参数、不到25MB即可实现云端TTS品质的Kitten TTS V0.8。探讨边缘设备部署的可能性及本地语音AI最新趋势。
· ZH
30美元收音机 + 本地AI = 无需互联网的智能家居 — 边缘AI实用案例
仅凭Mac mini和30美元的LoRa收音机,在没有互联网的情况下实现语音控制和智能家居操作的实战案例分析。深入探讨本地AI×IoT的具体实现与成本。
· ZH
BarraCUDA — 在AMD GPU上运行CUDA代码的开源编译器
深度解析BarraCUDA开源编译器,无需LLVM或HIP转换层,即可将CUDA .cu源码直接编译为AMD RDNA3 GPU机器码。本文完整涵盖其15,000行C99实现的架构原理、所支持的CUDA功能清单,以及对打破NVIDIA GPU市场垄断格局的重要意义。
· ZH
Claude Sonnet 4.6发布 — Anthropic的中端模型战略与性能分析
全面解析Claude Sonnet 4.6发布背后Anthropic的版本策略:Opus·Sonnet·Haiku产品线调整、性能基准对比、API成本效率变化,为开发者提炼系统升级时必须关注的关键技术要点与决策依据。
· ZH
DeepSeek V4即将发布 — 中国AI下一代模型竞争加速
DeepSeek V4发布在即,Qwen3.5、GLM-5等中国AI企业的模型大战持续升温。本文深入分析相比DeepSeek-R1的推理性能提升与编程基准改进,并探讨开源LLM逼近GPT-4级性能背景下全球AI竞争格局的深层变化。
· ZH
KaniTTS2 — 仅需3GB VRAM即可实现语音克隆的开源TTS模型
4亿参数轻量级TTS模型KaniTTS2已开源发布,仅需3GB VRAM即可实现零样本语音克隆,预训练代码完全公开。本文分析MOS评分和语音克隆质量,并深入探讨其在本地AI环境中的实际应用潜力与语音AI民主化意义。
· ZH
仅用CPU在1.2小时内训练LLM — MatMul-Free架构的可能性
分析仅用CPU在1.2小时内训练出1360万参数语言模型的FlashLM v3案例。深入解读消除矩阵乘法、采用三值权重的MatMul-Free架构原理,及其在内存与能耗效率、边缘AI和低成本训练方面的意义与应用前景。
· ZH
AGENTS.md真的有效吗?首篇实证论文揭示了意外的结果
GitHub上已有超过6万个仓库使用AGENTS.md,它真的有效吗。ETH Zürich的首篇实证论文发现,LLM生成的文件反而让成功率下降3%,开发者手写文件也仅提升4%,而推理成本增加超过20%。本文分析这一结果及其原因。
· ZH
AI自我生成的技能毫无意义 — 颠覆LLM自我改进神话的实证研究
SkillsBench实证研究表明AI代理的技能自动生成实际上毫无帮助。在7,308条轨迹中,自我生成技能的效果为零,而人工策划技能提升了16.2个百分点。
· ZH
FunctionGemma 270M — 超小型模型实现多轮tool calling精度90-97%
分析270M参数超小型模型FunctionGemma通过微调将多轮tool calling精度从10-39%提升至90-97%的案例。这是Scaling Law并非唯一答案的又一证据。
· ZH
OpenRouter周榜TOP5中4个是开源模型 — 闭源模型优势的终结
OpenRouter周使用量排行TOP5中4个为开源模型(Qwen3-Coder、DeepSeek R2、MiniMax M2.5等)。分析闭源模型优势的终结以及开源模型在实际使用中被选择的原因。
· ZH
Qwen 3.5在Vending-Bench 2中破产 — 基准测试偏重的陷阱
在标准基准测试中名列前茅的Qwen 3.5,在自动售货机经营模拟Vending-Bench 2中破产。探讨基准测试偏重带来的AI评估盲区。
· ZH
Claude Code使用本地模型时全量重新处理提示词 — 架构低效性分析
分析Claude Code在本地LLM上运行时发生的全量提示词重新处理问题的原因和解决方案。深入解析KV缓存失效机制与开发者工具设计的经验教训。
· ZH
Heretic 1.2 — 量化实现VRAM降低70%与MPOA技术全解析
Heretic 1.2正式发布。通过4bit量化将VRAM使用量最多降低70%,MPOA技术实现高质量消融。详解本地LLM运营成本削减的最新方法。
· ZH
Karpathy:AI训练成本每年下降40% — 通缩正在重塑行业格局
Karpathy分析显示AI模型训练成本每年下降40%。本文解析硬件演进、算法效率化、数据管道优化等结构性因素及其对行业的深远影响。
· ZH
如何在8GB VRAM上运行Qwen3-Coder-Next 80B — 量化技术详解
分析在8GB VRAM消费级GPU上运行80B参数编码AI模型的量化和懒加载技术。探讨本地LLM编码的实用性与局限性。
· ZH
AI集群构建SQLite克隆 — 多智能体分工的现实
Claude、Codex、Gemini共6个AI智能体并行构建了19,000行Rust SQLite克隆。分析多智能体分工与协调成本的现实。