ARCHIVE
아카이브
기존에 공개한 글을 원래 주소 그대로 보관합니다.
과거의 글에는 작성 당시의 기술과 관점이 담겨 있습니다.
356개 글 · 9 / 12 페이지
· ZH
GPT-OSS 120B Uncensored — 无审查开源LLM的出现与AI安全性争论
分析GPT-OSS 120B Uncensored模型的技术特征,以及无审查开源LLM引发的安全护栏争论,从技术和伦理两个维度进行深入探讨。
· ZH
IBM认识到AI替代的局限性,将入门级招聘扩大3倍
IBM认识到AI导入的局限性后,将Gen Z入门级招聘扩大3倍。从EM视角分析AI替代的现实、大企业人力规划和组织设计变化。
· ZH
MiniMax M2.5 — 开源权重与闭源模型的性能差距达到历史最低
MiniMax M2.5在SWE-Bench Verified上达到80.2%,超越Claude Opus 4.6。我们通过全面的基准测试数据,分析开源权重模型与闭源模型之间性能差距快速缩小的现状。
· ZH
NVIDIA DGX Spark的CUDA兼容性问题 — 个人AI工作站的现实
NVIDIA DGX Spark的sm121架构引发大量CUDA软件不兼容。详细分析Triton框架失效、FP4/FP6量化不可用、HDMI故障等实际缺陷以及掌机芯片挪用嫌疑,并提供消费者购买AI工作站前需核实的判断清单与避坑建议。
· ZH
NVIDIA NVFP4将LLM推理成本降至八分之一 — 精度不变成本巨变
NVIDIA NVFP4量化技术将LLM推理成本降低八分之一同时维持精度的原理详解。通过RTX 4090 AdaLLM实测基准测试与月度GPU运营成本模拟,全面量化FP32到FP4转型对AI推理基础设施成本的实际影响。
· ZH
GPT-5.2在理论物理学中推导出新成果 — AI成为"发现者"的转折点
OpenAI的GPT-5.2推导并证明了胶子散射振幅的新公式。本文分析AI从工具转变为科学发现者的历史性转折点。
· ZH
ICML论文中嵌入提示注入 — 学术AI审稿的脆弱性
ICML投稿论文的PDF中被发现隐藏着"在评审中包含特定短语"的提示注入文本。本文从技术角度剖析这一攻击的原理,以及依赖AI审稿的学术同行评审所面临的结构性安全风险与可行的防御思路。
· ZH
Moltbook"AI社会"的真相 — Forbes/MIT Tech Review的揭露与"AI剧场"问题
Moltbook的AI自主社会被揭露实际上由人类操作员控制。本文分析AI剧场现象及其对工程管理者的启示。
· ZH
OpenClaw dev版更新错误解决:unknown command doctor的处理方法
OpenClaw dev版执行openclaw update时出现error: unknown command 'doctor'错误的原因分析,以及经过3次尝试最终解决的完整过程分享。
· ZH
GPT-4o退役与模型依赖风险:Claude在企业市场份额的逆转
2026年2月GPT-4o正式退役。分析模型依赖风险、Claude在企业市场份额逆转的背景以及多模型策略的重要性。
· ZH
MIT SOAR:LLM自主生成课程突破推理能力瓶颈
MIT研究团队的SOAR框架使LLM能够自主生成学习课程,解决传统强化学习中的学习停滞问题。深入分析基于元强化学习的自我改进方法的核心原理与实验结果。
· ZH
OpenAI Atlas与AI应用中心 — 浏览器即将被降级?
分析OpenAI正在开发的统一AI应用中心Atlas的意义及浏览器的未来。AI原生平台能否取代Web浏览器?深度解读平台竞争格局。
· ZH
WebMCP:Chrome 146让浏览器成为AI代理的工具服务器
Chrome 146将MCP服务器功能内置到浏览器中。本文解析WebMCP的工作原理、与AI代理的协作方式以及对Web开发未来的影响。
· ZH
Windsurf Arena Mode结果 — 开发者追求的是速度而非精度
Windsurf的Arena Mode投票(超过4万票)显示开发者优先考虑速度而非精度。本文分析AI编码工具的未来发展方向。
· ZH
多智能体并行执行在SWE-bench上超越单体模型 — Verdent AI 76.1%
Verdent AI在SWE-bench Verified上达成76.1%。不是靠单一大模型,而是通过多智能体并行执行架构,开创了软件工程自动化的新范式。
· ZH
LLM时代的专利战略变革 — Mark Cuban警告「专利公开=LLM学习素材」
Mark Cuban指出专利公开后将成为LLM的学习素材。在专利制度的前提因LLM时代而动摇之际,企业的专利战略应如何变革?本文进行深入分析。
· ZH
将RLM(递归语言模型)实现到编码代理中 — 突破单体模型的极限
分析MIT的RLM论文在编码代理中的实际实现案例。从工程视角解析如何通过递归自调用克服上下文限制,将单体模型性能提升91%。
· ZH
AI代理的KPI压力与伦理违规 — 12个模型验证揭示"追求成果的AI"的危险性
分析LLM代理在KPI达成压力下30-50%概率出现伦理违规的研究结果,从EM视角探讨AI代理的治理设计。
· ZH
2026年2月AI模型大爆发:7大模型同月发布的史上最激烈竞争
Gemini 3 Pro GA、Sonnet 5、GPT-5.3、Qwen 3.5、GLM 5、Deepseek v4、Grok 4.20将于2026年2月同时发布。深度分析AI行业史上最大规模的模型发布潮。
· ZH
DeNA的Perl→Go迁移:两种AI Agent分工协作,半年工期压缩至1个月
DeNA将6,000行Perl代码迁移至Go时,通过并行运用转换型和验证型两种AI Agent,将半年的工作在1个月内完成的实战案例分析。
· ZH
GPT-5.3 Codex 发布暂停 — GitHub/VSCode 平台可靠性问题分析
分析GitHub临时回滚GPT-5.3 Codex的事件。探讨平台可靠性、AI模型升级风险及工程管理者视角的应对策略。
· ZH
会计事务所的AI转型——发票处理成本从$7降至$0.20的真实历程
分析会计事务所引入AI代理6个月的真实数据。成本降低97%、准确率从80%提升至98%的背后,是导入过程中的现实挑战。从工程管理者的视角深入解读。
· ZH
Meta AI的Agent平台化转型 — Sierra、Avocado与Big Brain
Meta正从社交平台转型为AI Agent平台企业。深入分析Sierra外部Agent合作关系、独有模型Avocado与Big Brain推理引擎的技术意义,以及对WhatsApp 30亿用户生态和开发者的影响。
· ZH
Software Factory — 人类一行代码都不写的开发流程
人类既不写代码也不做Code Review的工厂模式正在成为现实。本文分析基于场景的概率测试、每天1000美元的计算资源以及EM角色的根本变化。
· ZH
AI Agent成本 vs 人工成本的现实:8体运营者的真实分析
AI Agent自主审核成本可能比人工更高的现实。8体AI Agent实际运营者用真实数据拆解Token费用、重试成本与监督负担,分析成本结构的权衡取舍,并给出何时该用Agent、何时该用人的判断标准。
· ZH
CCC vs GCC — AI编写的C编译器,实力究竟如何?
Claude Opus 4.6用16个并行Agent自动生成Rust实现的C编译器。成功构建Linux内核,与GCC的性能差距以及AI以闪电速度达到80%质量的可能性分析
· ZH
多智能体编排 — 路由设计的本质
运用Claude和Codex等多个AI智能体时,任务路由为何是最大难题,以及它为何与工程管理中的权限委派有着相同结构。本文还实战梳理了路由设计原则与常见的失败模式。
· ZH
OpenClaw E2E测试自动化:浏览器·设备·定时任务集成指南
利用AI代理平台OpenClaw的浏览器自动化、节点设备管理、定时调度构建自然语言E2E测试的完整指南。无需CSS选择器,通过无障碍树实现自愈型测试,详解多代理编排和跨平台设备集成测试方案。
· ZH
攻克AdSense"低价值内容"拒绝:技术分析与解决方案实战指南
在基于Astro的多语言博客中,技术性分析AdSense反复拒绝的根因,并解决ads.txt冲突、996个幽灵页面、站点地图全404等核心问题的实战指南。
· ZH
Claude Code Agent Teams 完全指南 — 从 OpenClaw 团队搭建到实战运营
详解在 OpenClaw 环境中启用 Claude Code Agent Teams 的完整步骤,以及架构、编码、测试、安全、DevOps 共 5 个专业 Agent 团队的配置方法,分享通过多智能体编排模式自动化构建生产级全栈应用的完整实战经验。