这里记 AI 行业里值得留下判断的事:模型能力的真实边界、Agent 工程化的可行路径、开源生态的变动,以及那些被宣传盖过去的技术细节。

写法上有个自我要求——事件给事实,判断给理由。如果一个结论说不出"我凭什么这么认为",那它就不该出现在这里。

范围覆盖:大模型与多模态进展、Agent 与 Harness 架构、AI 编程工具链、评测体系(eval)、开源模型与平台博弈。