ASIC推理芯片让Llama 3.1 8B达到16,000 tok/s — 无GPU的AI推理时代
ASIC专用芯片初创公司Taalas在无GPU条件下以16,000 tok/s运行Llama 3.1 8B。分析摆脱GPU依赖的趋势与推理成本结构的剧变。
archive
356 · 第 19
ASIC专用芯片初创公司Taalas在无GPU条件下以16,000 tok/s运行Llama 3.1 8B。分析摆脱GPU依赖的趋势与推理成本结构的剧变。
Together AI发布的CDLM将扩散语言模型的推理速度提升最高14倍,同时将质量损失降至最低。块级并行生成与KV缓存的结合是关键突破。
Google发布Gemini 3.1 Pro,在ARC-AGI-2上达到77.1%,推理性能提升2倍以上。本文分析其性能指标、与Claude的对比及多模态进化。
ik_llama.cpp开发的IQ系量化方法正式合并至llama.cpp主线。详解IQ2_K至IQ4_KS的精度提升与本地LLM推理效率优化的技术背景。
ggerganov重构llama.cpp计算图,使Qwen3 Coder Next 80B模型推理速度提升最高38%。详细解析优化技术与基准测试结果。
DDR5 RDIMM的每GB价格已低于RTX 3090的VRAM,标志着本地LLM硬件选择的转折点。本文分析CPU推理与GPU推理的成本结构。
Mistral Devstral Small 2 24B和Qwen3 Coder 30B同时登场。可在Raspberry Pi上运行的小型编码模型对比分析及本地AI编码的未来展望。
深入分析14M参数、不到25MB即可实现云端TTS品质的Kitten TTS V0.8。探讨边缘设备部署的可能性及本地语音AI最新趋势。
仅凭Mac mini和30美元的LoRa收音机,在没有互联网的情况下实现语音控制和智能家居操作的实战案例分析。深入探讨本地AI×IoT的具体实现与成本。
深度解析BarraCUDA开源编译器,无需LLVM或HIP转换层,即可将CUDA .cu源码直接编译为AMD RDNA3 GPU机器码。本文完整涵盖其15,000行C99实现的架构原理、所支持的CUDA功能清单,以及对打破NVIDIA GPU市场垄断格局的重要意义。
全面解析Claude Sonnet 4.6发布背后Anthropic的版本策略:Opus·Sonnet·Haiku产品线调整、性能基准对比、API成本效率变化,为开发者提炼系统升级时必须关注的关键技术要点与决策依据。
DeepSeek V4发布在即,Qwen3.5、GLM-5等中国AI企业的模型大战持续升温。本文深入分析相比DeepSeek-R1的推理性能提升与编程基准改进,并探讨开源LLM逼近GPT-4级性能背景下全球AI竞争格局的深层变化。