把 OPCKITS 各个工具背后的思路写成能落地的方法论长文。每篇都可以在线读,也提供排版好的 PDF 版本下载、打印。
过去十几年,编程语言榜单之间的分歧一直在可解释的范围内:口径不同,名次差几位,方向大体一致。2026 年这个默契破了。同一个月,同一门语言,两个榜单给出了完全相反的方向。这不是某一家算错了,是它们赖以计数的那些人类行为,正在批量迁移到私有的 AI 会话里。这篇不谈哪门语言最好,只谈一件事:这些榜现在还能不能读,以及怎么读。
2026 年 8 月 13 日,DeepSeek 把自己内部用来跑模型评测的那套 agent 框架整个开源了:MIT 协议,TypeScript,名字叫 DeepSeek Harness,命令行是 dsh。仓库上线约一天拿到 9.3 万 star。它不是又一个 Claude Code 克隆,而是一个可以从配置层把任何部分换掉的底座。这篇按「它是什么、怎么组装的、怎么跑起来、和成品工具差在哪、有哪些坑」的顺序拆开讲,每个技术细节都来自官方仓库文档,第三方数据单独标注口径。
2026 年 7 月 31 日 V4-Flash 正式版上线,四天登顶 OpenRouter 周调用量榜,一周吃掉 7.22 万亿 token。真正值得记住的不是「又便宜了」,而是它同时打掉了三个行业默认前提:参数越多越聪明、贵模型贵得有道理、后训练必须靠混合强化学习。这篇按七个点逐层拆,每个数字都标明口径,最后给一人公司一份可执行的模型路由建议。
x402 是这一轮 agent 支付叙事里最常被提到的名字,也是最容易被两套数字带偏的一个。它复用了一个闲置多年的 HTTP 状态码,让机器在一次请求里完成付款;它经历过单周涨幅超过 10000% 的刷量狂欢,也经历过日交易量从峰值回落 92% 的退潮。这篇不做预测,只把 2025 年 5 月到 2026 年 8 月之间可核对的事实、口径和争议摆在一起。
AI Agent 正从「生成答案的软件」变成「能代表组织调用服务、选择供应商并产生支出的执行者」。x402 把付款嵌进 HTTP 请求,AP2 用意图和授权链解决「谁批的」,钱包和卡组织解决「怎么付」。但企业真正关心的从来不是能不能付成,而是这笔钱该不该花、在不在预算内、算谁的账、有没有换来结果。这篇是对这一层空缺的完整市场判断。
找一款模型有没有备案,官方渠道是网信办分批发布的公示附件。问题是这些附件从来没有合成过一份完整名单:12 批公示各自独立,批次顺序错乱,早期附件的中文标题连复制都复制不出来。我们把它们全部合并、清洗、按时间倒序重排成一份可检索的名录,988 条备案加 598 条登记,序号连续无缺号,顺便修掉了原件里的三处数据错误。
90% 的踩坑都发生在同一个地方:把「大模型登记」和「大模型备案」当成一回事,选错通道,白等几个月。判断规则其实只有一句话:你有没有动模型本身。没动,走省级登记;动了,走中央备案。但登记不是全部,调用型应用还得同时做算法备案,只办一样上线仍然不合规。
MCP 已经从协议变成基础设施:捐给 Linux 基金会成为厂商中立标准,官方 Registry 收录近万个 server,SDK 月下载近亿次。这意味着「做一个 MCP server」本身已无任何稀缺性。这篇基于 claude.ai 目录约 700 个连接器的实地盘点,回答一个问题:在一个供给已经爆炸的市场里,什么样的 MCP 生意还立得住。
很多人的认知还停在「写好提示词」,少数人停在「接好 MCP」,而行业已经走到第三阶段。一句话主线:能力正从模型里溢出,流到模型外面的那层系统上。模型能力在快速商品化,差异化的位置持续外移,从提示词到上下文,再到围绕模型的整套运行系统。谁掌握外面那层,谁就掌握产出质量。
大多数一人公司死在选题,而不是执行。这套方法论把「这个项目适不适合我一个人做」拆成两步:先用 5 条硬红线挡掉根本不成立的方向,再用六个维度给剩下的想法打分。它既评项目本身成不成立,也评你是不是做这件事的对的人。
「我有一个好点子」是一人公司最贵的一句话。灵感驱动的选题,赌的是市场恰好和你想的一样;抱怨驱动的选题,起点就是市场已经发出的信号。这篇方法论讲清楚三件事:去哪里听抱怨,怎么判断抱怨背后是不是真需求,以及怎么把它变成可验证的机会。