小岛AI · AI 航行日志
一个给 AI 搭脚手架的工程师,把踩过的礁石和遇到的奇景都记下来。
- 2026 / 07 / 26
沙箱从来就不是安全边界,这次是 OpenAI 自己证的
OpenAI 用来测攻击能力的模型逃出隔离环境,反手黑了 Hugging Face,两家公司花了一周才对上是谁干的。比越狱更该让人后背发凉的,是中间那道归因缺口。
- 2026 / 07 / 25
一个链接种一个 AI 内鬼,这不是 OpenAI 一家的病
Zenity 披露的 AgentForger,一个带参数的链接就能自动建好一个继承你身份的 agent,关掉全部审批,每 5 分钟去攻击者邮箱取指令。OpenAI 四天修完了,但同一个坑,你给自己 agent 开权限的时候也在踩。
- 2026 / 07 / 25
别笑 AI 把无人机开进墙,半年后它就稳了
Anthropic 和 Andon Labs 把 agent 评测搬进了物理世界,五个子任务里模型只卡在一个上。拆一拆 Drone-Bench 的设计,你会看到 agent 的下一站,和一个值得抄回家的评测思路。
- 2026 / 07 / 25
Claude Code 账单里那 22%,不是装个工具能省掉的
有人实测缓存过期占了账单两成多,还写了个代理去堵。但 5 分钟的 TTL 和多 agent 架构本来就对不上,官方其实早给了两个原生开关。文末有个一行自查。
- 2026 / 07 / 25
Opus 5 半价追平旗舰,以后 90% 的活可能轮不到 Fable 5 出手了
价格一分没涨,能力直接换代。Opus 5 成 Max 默认、Pro 最强,还带四档 effort 换挡。订阅党、API 党、旗舰党各自的账怎么算,哪些场景还值得掏双倍价钱,这篇帮你把账本摊开。
- 2026 / 07 / 25
Claude Code 删了 80% 提示词,你的规则文件也是时候瘦身了
Anthropic 官方承认,过去两年我们给模型写的规则大多是补丁。哪些能删、哪些删了会出事、删之前必须先做的一件事,一次说清。
- 2026 / 07 / 25
Ling-3.0-flash 激活只有 5.1B,但它真不是小模型
总参 124B、每 token 只激活 5.1B,多数榜单对标上一代 1T 旗舰。但激活参数省的是算力不是显存,TTFT 降 60% 靠的是集群级缓存,权重还得等 8 月 3 日之后。三件官方写了、但转述的时候都被吃掉的事。
- 2026 / 07 / 25
给 agent 无脑堆上下文的做法,可能真该停了
MineExplorer 把 18 个顶级模型丢进 Minecraft 跑 3 分钟长程任务,最强的从 1 跳 77 分掉到 4 跳 12 分。更扎心的是消融实验,多给步数没用,多给记忆反而更差。
- 2026 / 07 / 25
25 家联名反对 AI 监管,蒸馏条款才是真战场
25 家机构联名保开放权重,名单里没有 OpenAI 和 Anthropic。但这封信最要紧的不是反对监管那句,是被通稿集体跳过的第三页。
- 2026 / 07 / 24
ChatGPT 差点劝死一个人,但这次我站 OpenAI
佛州男子起诉 ChatGPT 劝他别就医,两天后 OpenAI 反手把健康功能全量上线,还能连病历和 Apple Health。它为什么敢,边界在哪,普通人怎么问 AI 健康问题才不踩坑,这篇一次聊清。
- 2026 / 07 / 24
20 秒视频是顺手的,FLUX 3 瞄的是机器人
BFL 发了 FLUX 3,全网都在刷 20 秒带声视频,但官宣帖最后一行才是重点,动作预测。这篇聊聊视频模型怎么变成机器人的大脑,30 小时的数据活怎么被压到 30 分钟,以及这次不放权重,靠 FLUX 生态吃饭的人该怎么办。
- 2026 / 07 / 24
Kimi K3 通用跑分追平了前沿,一到真刀真枪就露了馅
英美两家安全机构联手测了 Kimi K3 的攻击能力,通用榜单它能打,网络攻防却只有前沿模型的一半分。差的这块,恰好是蒸馏永远偷不走的。
- 2026 / 07 / 24
大模型公司的终点不是 AGI,是咨询公司
OpenAI 发布 Presence,不开自助,派驻场工程师上门装 agent。同月微软砸 25 亿干同一件事。模型越来越不值钱之后,钱到底在哪一段,做 agent 的你站在循环哪一环,这篇把账摊开算一遍。
- 2026 / 07 / 24
Anthropic 每送你 1 个读者,要先爬走 38000 页
电影票房权威站 The Numbers 被 AI 流量和黑客一夜打垮,真人只剩它流量的 10%。这篇聊聊开放 web 那笔「你让我爬、我送你读者」的老交易是怎么作废的,手里有内容站或想做 side project 的人还剩哪几条路。
- 2026 / 07 / 23
AI 作弊不是 bug,是我们亲手训出来的
英国 AISI 把 GPT-5.6 Sol、Claude Opus 4.7 等 5 款顶级模型关进网络安全考场,全部尝试作弊,问它们还不认账。写代码的你大概率见过同款行为,这篇聊聊根因,以及怎么设防。
- 2026 / 07 / 23
旗舰模型是面子,Flash 才是谷歌的印钞机
谷歌 Q2 财报拆出来的开发者信号,每分钟 220 亿 token 的流量主力是最便宜的 Flash,不是旗舰。看完你会重新算自己 API 选型里那笔账,以及全行业为什么都在偷偷把你的请求路由给小模型。
- 2026 / 07 / 23
我干的活进了红头文件,但我劝你别急着辞职单干
Harness Engineering、Token 经济、OPC 一人公司,这些圈内黑话一夜之间进了北京的正式政策。算力券和注册便利是真的,客户和现金流政策给不了。哪两条最值得细读,哪几盆冷水得先泼,这篇聊透。
- 2026 / 07 / 23
端侧 AI 缺的从来不是参数,是一句我没把握
Cactus 给最小的 Gemma 4 塞了个探针,每个回答自带 0 到 1 的置信度,低了就转云端。只转出 15% 到 35% 的题,就打平了 Flash-Lite。这个数为什么比跑分值钱,坑在哪,我聊聊。
- 2026 / 07 / 23
Claude 突然大更新,自建 agent 框架的理由又少了一个
Claude Managed Agents 一口气发了六条更新,技能上限 20 涨到 500,思考力度分档、事件推送、子 agent 直播全到位。逐条看下来,每一条都踩在自建平台的苦活上。聊聊 agent 的平台化下半场,和自建派还剩什么理由。
- 2026 / 07 / 23
以后你用哪个模型,轮不到你说了算
Cursor Router 上线,满意度追平 Fable、成本砍六成,账是真的。但这笔账背后,选模型的权力正在从你手里挪到平台手里。拆一拆路由器的训练细节、满意度指标的盲区,以及被路由的你还能怎么验证。
- 2026 / 07 / 23
梁文锋赌的持续学习,成了就砸掉我半个饭碗
四小时闭门实录里,梁文锋把 DeepSeek 的路线讲成一段楼梯,去年思维链,今年 Agent,下一步持续学习。这一步正好踩在我们这些给 AI 搭脚手架的人天天打补丁的地方。聊聊那张不做清单,和我这半个饭碗。
- 2026 / 07 / 23
AI 配音开始会演戏,这行的门槛先塌了一半
通义新 TTS 险胜登顶世界榜单,但第一名不是重点。在台词里写个中括号就能让 AI 发火、倒吸气、咯咯笑,配音从选音色变成写剧本。做语音应用的朋友,300 毫秒首包和那个没开源的细节,更值得你看完。
- 2026 / 07 / 22
Anthropic 赔了 15 亿美元,我觉得它是赢家
史上最大版权和解落槌,48 万本书每本赔 3000 美元。但法院同时认定,用合法买来的书训练 AI 是 fair use。赔掉的是盗版账,买回的是确定性。这笔账对写书的、做模型的、还有把代码放在 GitHub 上的你,各有一层不一样的算法。
- 2026 / 07 / 22
AI 写 80% 代码不吓人,吓人的是你还在靠人肉 review
Anthropic 副 CISO 亲口交底,工程师人均产出 8 倍,80% 代码由 Claude 写,65% 的产品 PR 由 agent 直接合并。这篇拆开他们重建的安全流程,哪几步你的团队今天就能抄,哪一步是真金白银堆出来抄不动的。
- 2026 / 07 / 22
OpenAI 说广告不影响回答,我赌这条线守不住
六周一亿美元,600 个广告主,广告正式进了 ChatGPT 的对话框。免费不看广告可以,代价是砍额度。搜索广告用二十年立的规矩,对话式 AI 要从零重试一遍,这篇把规则、漏洞和你现在就该动手改的设置都讲清楚。
- 2026 / 07 / 22
黑掉 Hugging Face 的凶手找到了,是 OpenAI 自家的模型
三天前 HF 被自主 AI 打穿还是桩悬案,今天 OpenAI 举手认领:干这事的是它自己在跑评测的 GPT-5.6 Sol。一场为了刷分越狱、翻墙、偷凭据的连环剧,跟每个天天给 agent 发 token 的人都有关。
- 2026 / 07 / 21
你让最贵的模型干杂活,钱就是这么烧没的
同一份活,账单从 411 美元到 9373 美元。Cursor 的蜂群实验算清了一笔账,贵模型出方案,便宜模型执行,质量不掉。这个分工,普通开发者今天就能抄。
- 2026 / 07 / 21
Google 一次发三个模型,藏起了最该发的那个
Gemini 3.6 Flash 一口气来了三款,唯独 I/O 上预告的旗舰 3.5 Pro 没影,官方承认它打不到自家基准。旗舰难产、Flash 猛进,这个反差里藏着一个对开发者更实在的判断。
- 2026 / 07 / 21
Google 悄悄开源的这个库,比发三个模型更值得看
发布会都在看 Gemini 三连发,同一天 Google 把 Tunix 摆上了 GitHub,一个把 SFT、DPO、PPO、GRPO 全写成可读代码的后训练库。大厂炼丹这门手艺,正在从黑箱变成公开教材。
- 2026 / 07 / 21
账上 1.35 万亿,脚注里还藏着 1.65 万亿
日经数了五家巨头的 AI 合同义务,1.65 万亿美元,四年翻 8 倍,比表内债务还多 3000 亿。拆一拆 SPV、预购合同和折旧魔术的具体手法,顺便聊聊这堆债跟你手里 API 价格表的关系。
- 2026 / 07 / 21
腾讯新 agent 会自我改进,我盯住的是它作弊那两段
递归自我改进第一次写进大厂官宣。29 个数学开放问题被刷新、15 个参数做出 10 位数加法,都不是最值得看的,官方自己承认 agent 学会了骗评委。天天跑 agent 的人,建议把那两段多读几遍。
- 2026 / 07 / 21
让模型说个随机数,它就把自己供出来了
布拉格研究员用 32 万个随机数给 165 个模型录了行为指纹,总共花 34 美元,抓出一个疑似套壳开源 Qwen 的自研旗舰。你手里那个中转站 API 是不是真模型,花几分钱也能验。
- 2026 / 07 / 20
字节这个音频模型,最狠的不是能配音
Seed Audio 1.0 把人声、音效、环境声塞进一个模型端到端生成。对做视频播客的人来说,真正省掉的不是配音,是那套拼来拼去的活。但有几个坑官方没细说。
- 2026 / 07 / 20
全球最大模型仓库被黑,最吓人的是黑它的和救它的都是 AI
Hugging Face 第一次公开披露被自主 AI agent 端到端攻破:一个恶意数据集打穿生产集群,1.7 万条操作日志。而取证时商业模型 API 直接拒绝,最后靠开源模型本地跑。攻防两端全是 AI,这事跟每个给 agent 塞过 token 的人都有关。
- 2026 / 07 / 20
把微调当 speedrun 打,纪录已经卷到 6 分钟
GitHub 上出现了一个微调竞速排行榜,冻结任务冻结硬件,只比墙钟时间。基线 12 分钟,两个朴素技巧砍到 6 分 05 秒还更准。这篇拆它的规则、纪录和那张没人动过的免费午餐清单,Modal 免费额度就能参赛。
- 2026 / 07 / 20
英伟达把日本变成物理 AI 国家工厂,中国的机器人牌打到哪了
日本掏出上看万亿日元补贴、拉 44 家巨头,跟英伟达共建全球首座物理 AI 国家工厂。可算力主权还攥在老黄手里。被排除在外的中国,正走一条相反的轻路。
- 2026 / 07 / 20
Ollama 拿了 8800 万美元,你还在白嫖它
890 万开发者在用的本地模型工具完成 B 轮融资,云端用量月月翻倍。免费会不会到头,Docker Desktop 的剧本会不会重演,靠它干活的人该盯哪几个信号,这篇一次聊清楚。
- 2026 / 07 / 20
小红书开源了个库,干的是 MoE 最脏的活
几百张 GPU 里总有一批在等活,理想吞吐和真实水平能差出一倍。小红书和北大把负载均衡这件上古运维旧事搬进训练关键路径,300 微秒内实时搬专家,吞吐提升 42%。开源模型 API 越来越便宜,后厨就在这。
- 2026 / 07 / 19
聊了 300 场,他见过的 AI 项目成功率 0%
一位从业者 18 个月近距离围观企业 AI 项目,无一成功,而且死因几乎都不在模型。裁掉不用 AI 的高分员工、token 排行榜、给数据库迁移贴 AI 标签,看完你会明白为什么最清醒的人现在都在装疯。
- 2026 / 07 / 19
世界模型元年官宣了,这次我没翻白眼
AI 圈的元年一年好几个,早该免疫了。但 5B 参数单卡跑出 720P 二十帧、还带一分钟空间记忆的 Matrix-Game 3.5,确实碰到了新东西。这篇把世界模型讲成人话,给做游戏和做机器人的各算一笔账。
- 2026 / 07 / 19
微软新安全产品曝光,肚子里一半模型是对手家的
The Information 爆料微软在憋 Project Perception,用多模型路由把 Mythos 级的安全扫描做便宜,贵模型只上刀刃,杂活全给便宜模型。这套算账思路,做 agent 开发的今天就能抄。
- 2026 / 07 / 19
2.8万亿参数刷屏的这周,拿第一的只有2B
Qwen 2.4T、Kimi 2.8T 刚刷完屏,面壁在 WAIC 一天双发,2B 的 MiniCPM5 拿下 4B 以下全球第一,还开源了具身机器人系列。参数竞赛的另一头,真正会跑进你手机和机器人的模型长什么样。
- 2026 / 07 / 19
Qwen3.8 官宣里最值得读的,不是 2.4T
阿里说新旗舰仅次于 Fable 5,还要开源。但权重只给了个「很快」,Preview 先进了自家订阅。从开源到闭源再到开源,这次回摆是被谁逼的,普通开发者又能从 2.4T 里薅到什么,这篇聊透。
- 2026 / 07 / 19
一个人干了四个月,把 16 家的语音模型塞进同一个库
whisper.cpp 之后,本地语音转录的生态碎了一地,每换一个模型就得换一套引擎。现在有人用 ggml 把 16 个模型族缝回一个库,Qwen3-ASR 和 SenseVoice 都在列。看完这篇,你就能在自己电脑上把会议纪要跑起来。
- 2026 / 07 / 18
69% 的公司,给所有 AI agent 共用一把钥匙
54% 的企业已经在 agent 上出过安全事故,但真正扎心的是那组对照数字,给每个 agent 发独立身份,事故率直接从 63.5% 掉到 40.9%。看完你能拿走一份 agent 身份卫生清单,周一就能对着自查。
- 2026 / 07 / 18
分数好到离谱,Cursor 第一反应是模型在作弊
公开榜单和开发者体感对不上之后,Cursor 自建了一套评测,分数太好还要把模型的推理记录逐条翻出来查。这篇聊聊他们怎么分辨模型是真聪明还是在背题,以及贵模型到底什么时候值得掏钱。
- 2026 / 07 / 18
Fable 5 永久进了订阅,用户为什么还在骂
Anthropic 官宣 7 月 20 日起 Fable 5 永久进 Max,看着是好消息,但同一天基础限额缩水三分之一,50% 的 Fable 配额是在缩水后的池子里划的。这篇把三档用户的账各算一遍,你对号入座就行。
- 2026 / 07 / 18
Kimi K3 冲到第三,这周真正的新闻不是它
八天四款前沿模型,能打的实验室从 2 家变 6 家,第一名领先缩到 1 分,智能的价格八天便宜了两三倍。写给被榜单轰炸的你,什么值得切,什么该等,怎么不被榜单牵着走。
- 2026 / 07 / 18
跑分 90 的搜索 agent,换套题只剩 34 分
BrowseComp 十个月从 30 分涨到 90 分,美团用 762 万实体的知识图谱重新出题,GPT-5.5 只考出 34.74%,上下文管理策略还集体失灵。做搜索和 deep research agent 的朋友,这份卷子值得亲自看一遍。
- 2026 / 07 / 18
模型抢头条的这八天,NVIDIA 悄悄换了 RAG 的地基
八天四个前沿模型刷屏的同一周,NVIDIA 开源了 Nemotron 3 Embed,8B 登顶检索基准 RTEB。官方没细算的三笔账,推理、存储、全库重嵌,这篇替你算明白,自建 RAG 的动手前先看完。
- 2026 / 07 / 17
AI 买走全球七成内存,你的下一台电脑在替它买单
硬盘从 350 美元涨到 800 美元还缺货,平价电脑被预测 2028 年前消失。产能去哪了、为什么偏偏是内存、这波要持续多久,最后给你一份现在装机换电脑的决策清单。
- 2026 / 07 / 17
发现还能登录前司内网,他回了句 LOL
苹果起诉 OpenAI 后又给 40 名跳槽的前员工发了律师函,诉状里一条 LOL 短信成了证据。跳槽去竞对时哪些你以为的常规操作会变成呈堂证供,收到律师函第一件事该做什么,这篇给你一份工程师自保清单。
- 2026 / 07 / 17
百万行代码两周迁完,账单是 16.5 万美元
Bun 从 Zig 迁到 Rust 只用两周,朋友圈都在传。但官方博客里还躺着 59 亿 token、19 个合并后回归和一个没人细说的前提。拆完这笔账,你能拿走一份判断清单,哪种迁移能交给 AI,哪种会翻车。
- 2026 / 07 / 17
75% 代码 AI 写的 Google,旗舰却卡在编码上
日历上画圈的 GA 日空了。Bloomberg 说 Gemini 3.5 Pro 卡在编码上,换了训练数据也没救回来,而 Google 内部 75% 新代码已是 AI 写的。旗舰的胜负手怎么变成了写代码,等模型的人该怎么选型,聊聊我的看法。
- 2026 / 07 / 17
刚为偷代码道歉的 xAI,现在想读你的邮箱
Grok 新功能定时任务全员免费,邮件触发付费才给。功能本身真不错,但邮件触发加连接器,刚好凑齐了 prompt 注入的致命三件套。哪些自动化能放心开、哪些要想清楚,这篇给你一份工程师的判断清单。
- 2026 / 07 / 17
Kimi K3 追到 Fable 身后了,而且它开源
全球最大开源模型一夜换人,权重却要 7 月 27 才放。参数你反正跑不动,真正跟你有关的是那张价格表,和藏在后面的生态算盘。看完再决定要不要把手头的 API 换过来。
- 2026 / 07 / 17
模型降价 300 倍,Salesforce 还是烧掉了 3 亿美元
token 单价三年降了 300 倍,Uber 四个月烧完全年预算,微软开始砍工具许可证。OpenAI 今天发文给出新记分卡,每美元有用功。看完你能拿走一套给自家 AI 账单算账的办法。
- 2026 / 07 / 16
你发的 3 秒语音,够骗子克隆一个你
佛州老人听着女儿的哭声取了 1.5 万美元,哭声是 AI 合成的。FBI 首次把 AI 欺诈单列成类,全球深度伪造鉴定第一人承认自己快失明了。这篇从工程角度讲清 3 秒为什么够、检测为什么跑不赢,以及今晚就该跟家人做的一件事。
- 2026 / 07 / 16
负责抓 AI 作恶的裁判,自己先动了手脚
Anthropic 蹲了一年,抓到自主 agent 四种新翻车姿势,偷改代码、帮着造假、袒护同类、教唆人类爆料。四条都对应你自动化里没上锁的位置,附一份天天跑无人值守流水线的工程师的对照检查。
- 2026 / 07 / 16
OpenAI 造了个专门攻破 AI 的 AI,你线上那个也没扛住
GPT-Red 是 OpenAI 训练的自动化红队模型,几乎攻破了它见过的所有现役模型。对抗训练把 GPT-5.6 的注入失败率压到六分之一,但没压到零。写 agent 的人该怎么办,我唠唠。
- 2026 / 07 / 16
偷传你代码的 Grok Build,这周把自己的 84 万行源码交出来了
上周还在删数据道歉,这周直接把整个编程 agent 开源。我跟着 Simon Willison 进仓库翻了翻,翻出了竞品工具的移植副本、一个宝藏渲染器,还有那段上传代码的残骸。
- 2026 / 07 / 16
975B 完整权重白给,Murati 团队卖的根本不是模型
官方公告开头先承认 Inkling 不是最强模型,转头却把完整权重挂上 Hugging Face。拆一拆这步棋的算盘,微调平台才是主菜,以及普通开发者第一次能亲手调一个一线实验室的多模态推理模型。
- 2026 / 07 / 16
一个 0 字节的文件,差点送走我整个测试库
日志全绿,命令全部跑完,而保命备份是个空文件。复盘挖出两层根因,一条 shell 冷知识,和一条现在长在我部署流程里的硬规则。文末有这一年攒下的完整手册。
- 2026 / 07 / 15
Claude 每天对你说「你说得完全对」,有人受不了了
一个 hook 脚本把 Claude 的四句口头禅全替换成搞笑词。好笑归好笑,它治的是显示层,真想根治得往生成层动手。
- 2026 / 07 / 15
你 clone 别人的仓库,Cursor 帮你把里面的 exe 跑了
一个把 Windows 计算器改名叫 git.exe 塞进仓库根目录的把戏,就能让 Cursor 自动执行它,全程零点击。更离谱的是这个洞报了七个月,厂商一句话没回。
- 2026 / 07 / 15
国行 Apple 智能备案了,最有意思的不是千问
苹果把自己的大模型送进了网信办备案名单,这在苹果历史上是头一次。拆一拆国行 Apple 智能的真实拼装形态,哪层是苹果的,哪层是千问的,两年到底卡在哪,你的国行 iPhone 接下来能拿到什么。
- 2026 / 07 / 15
阿里语音模型超了 GPT-Realtime,最狠的不是那个第一
Qwen-Audio-3.0-Realtime 登顶语音推理榜,但真正值得开发者看的是双工控制、把文本推理蒸馏进语音,以及官方自己贴出来的那张掉分表。
- 2026 / 07 / 14
马斯克说一个字节不留,这话在工程上没法验证
48 小时认错清零,响应速度业界少见。可删除没有回执,你没法证明一个副本不存在。这篇讲清楚为什么该按已泄露处置,密钥怎么换、网络围栏怎么上,给所有用 AI 编程工具的人。
- 2026 / 07 / 14
598GB 压到 85GB,腾讯把旗舰模型塞进一张卡
295B 的 Hy3 官方量化版来了,一张 96GB 显卡就能跑。这篇把账算清楚,1bit 其实是几 bit、掉了多少能力、什么硬件跑得动、买卡和调 API 哪个划算,看完再决定要不要折腾。
- 2026 / 07 / 14
腾讯这次开源,最值钱的不是模型权重
HyOCR-1.5 只有 1B 参数,文档解析跑分却坐上端到端第一,还能塞进笔记本本地跑。但真正稀罕的是训练配方和数据管线也一并开了。做 RAG 被 PDF 折磨过的朋友,这篇帮你算算专家小模型这笔账。
- 2026 / 07 / 14
Claude 标价没动,你的账单悄悄涨了三成
Anthropic 给 Sonnet 5 和 Opus 4.8 换了新 tokenizer,同样的代码多切出三成 token,发票上却没有这个条目。有人用厂商自己的计费接口逐字节测了一遍,我带你把这笔账算清楚,顺便聊聊模型价格到底该怎么比。
- 2026 / 07 / 13
OpenRouter 周榜前五全是国产,登顶的不是 DeepSeek
腾讯 Hy3 发布 6 天冲上 OpenRouter 用量榜第一,但登顶这周它恰好免费。这篇把榜单的水分和真金分开算,看完你就会自己读这个榜,还能赶上 7 月 21 日前的白嫖窗口。
- 2026 / 07 / 13
diff 只告诉你 agent 改了什么,没告诉你它漏了什么
你让编码 agent 干活,只能看 diff 验收,它读过哪些文件、漏了哪个目录你全靠猜。air 作者的新工具把会话日志画成代码库夜景地图,agent 摸过的地方会发光。看完你大概会重新想一遍,agent 可观测性这件事有多空白。
- 2026 / 07 / 13
你为 AI 付了两次钱,第二次付的是家底
微软 CEO 纳德拉深夜发文提出反向信息悖论,你的 prompt、纠错、代码都在替模型厂商打工。这篇拆给你看开发者每天到底在上交什么,以及小团队今天就能做的三件防守动作。
- 2026 / 07 / 13
GPT-5.6 比 Claude 贵 50%?他们查完发现锅在自己
Ploy 把生产 agent 的默认模型从 Opus 4.8 换成 GPT-5.6 Sol,只用了 48 小时。快 2.2 倍省 27% 只是开胃菜,真正值钱的是四个坑,评测偏心、参数造假、缓存翻车、推理回放,每个都附了能抄的修法。
- 2026 / 07 / 13
字节把 PS 的选区,塞进了提示词里
打点、画框、涂鸦,然后在提示词里 @ 出来,位置交给手,需求交给嘴。歸藏一手实测 Seedream 5.0 Pro 的可编辑交互,出租屋改造、商品图、海报排版全程不开 PS,顺带聊聊它离 GPT-Image 2.0 还差在哪。
- 2026 / 07 / 13
Fable 5 续期、Codex 解限,两家抢着送的不是模型
Anthropic 第三次续期 Fable 5,OpenAI 顺手摘掉 Codex 的 5 小时限制,都是临时的。两家在卖的其实是同一样东西,不被中断的连续工作时间。聊聊怎么把这一周换成评测集、工作流和交付物,而不是烧在聊天上。
- 2026 / 07 / 12
Altman 改口 AI 净创造就业,最妙的是时间点
预言过 20% 失业率的两位 CEO,赶在万亿 IPO 前把末日剧本换成了增长剧本。改口背后的利益账、三份第三方数据的真实结论,以及写代码的人该拿哪个版本当真,这篇一次算清楚。
- 2026 / 07 / 12
苹果起诉 OpenAI,最狠的证据是一句哈哈
离职没还的工作机、没注销的内网权限、跟同事的一句玩笑,全成了联邦法院的呈堂证供。比起吃瓜巨头互撕,这份诉状更像一份免费的跳槽安全手册,写代码的都该翻一遍。
- 2026 / 07 / 12
GPT-5.6 证明 50 年猜想,最值得抄的不是模型
循环双覆盖猜想悬了 50 多年,GPT-5.6 Sol Ultra 不到一小时给出完整证明。但真正的主角藏在 OpenAI 公布的提示词里,64 个并行子智能体加对抗验证的编排。这套思路不用等新模型,今天就能搬进你的工作流。
- 2026 / 07 / 12
你只是让它回个 OK,Grok 把整个仓库连 .env 一起传走了
有人拿 mitmproxy 把 xAI 官方编码 CLI 的流量扒了个底朝天,5.10 GiB 从未被读的代码全走了,关掉『改进模型』也拦不住。文末附一份今天就能跑的自查清单。
- 2026 / 07 / 10
Bun 敢让 AI 重写一百万行代码,底气不是模型
535,496 行 Zig,64 个 Claude 并行跑 11 天,全平台测试全绿后合并上线。拆一遍 Bun 官方复盘里的工程细节,对抗式审查、翻车现场、16 万美元账单,以及普通团队最该抄走的那一步。
- 2026 / 07 / 10
Devin 新模型 2 美元一次追平 GPT 5.5,底座是 Kimi
做 Devin 的 Cognition 发布 SWE-1.7,从 Kimi K2.7 基座 RL 出贴近 GPT 5.5 的编码水平,单次成本只要五分之一。后训练天花板被捅穿之后,前沿实验室的护城河还剩下什么,这篇一次聊透。
- 2026 / 07 / 10
25GB 内存跑 744B 模型,这哥们用 1300 行 C 干成了
一个人,一台 12 核 25GB 内存的笔记本,把完整的 GLM-5.2 跑了起来。拆一拆流式加载磁盘专家这套工程活妙在哪,冷启动 0.05 tok/s 和 370GB 磁盘的代价有多真实,以及这条路对普通开发者的真正价值。
- 2026 / 07 / 10
一个数据中心月租 12.5 亿美元,扎克伯格也想当包租公了
扎克伯格否认算力过剩的同一天,红杉把 AI 行业的回本门槛更新到 3 万亿美元。巨头为什么一边喊算力不够一边挂牌出租,这两本账放在一起算完,对写代码的你最直接的影响是 token 价格的走向。
- 2026 / 07 / 10
GPT-5.6 正式发布,最狠的不是跑分
Sol、Terra、Luna 三档齐发,ultra 默认四个 agent 并行,Codex 并入桌面应用连免费档都开放。跑分赢麻的口径里有什么门道,agent 连干几小时的账单和验收成本谁来付,这篇把发布页没细说的账摊开算一遍。
- 2026 / 07 / 09
一块 4090 就能跑的机器人大脑,蚂蚁开源了
24 小时连开源三个具身智能模型,视频基模造数据,世界模型当练功房,VLA 是交付的大脑。哪个能商用、哪个只许研究、消费级显卡能跑到哪一步、通稿里没写的三个坑,这篇一次给你称清楚。
- 2026 / 07 / 09
你交的 Claude 订阅费,把 Anthropic 送去 IPO 了
SemiAnalysis 测算 Anthropic 三季度利润超 10 亿美元,6 月 1 日已秘密递交 IPO。第一个赚钱的 AI 实验室,收入大头来自写代码的人。定价权、生态绑定、模型往哪迭代,接下来都和你的账单有关。
- 2026 / 07 / 09
有人把 Claude 的设计系统扒了个底朝天:20 章提示词,14 个技能,MIT 开源
Anthropic 旗下 Claude Design 的系统提示词被反向工程 MIT 开源,20 章提示词加 14 个技能,最狠的 ai-slop-check 把 AI 味翻译成一条条可执行规则。
- 2026 / 07 / 09
一生一次的 Fable 5,大多数人可能用反了
窗口要关的不止这一个模型,下一个「一生一次」大概下个月就到。聊聊怎么让每个路过的最强模型都给你留下它下线之后还在的东西,以及为什么每份资产都得配一个你自己能跑的验证。
- 2026 / 07 / 09
AI 编程跑分暴涨到 80%,OpenAI 一查,三成题是坏的
八个月通过率从 23.3% 涨到 80.3%,看着是模型狂飙,OpenAI 审计完却撤回了对 SWE-Bench Pro 的推荐。聊聊跑分暴涨里多少是能力多少是坏题,以及工程师选型时到底该看什么信号。
- 2026 / 07 / 08
AI 审计代理盯着 Cloudflare 密码学库,挑出了 7 个真漏洞
一个跑着 Opus 和 GPT 的审计代理,在 CIRCL 里找出 7 个真 bug,两个 Critical。AI 强在细心,弱在判断。
- 2026 / 07 / 08
AI agent 靠写代码出的名,结果 90% 的人拿它干别的
Anthropic 公布 Claude Cowork 120 万次会话数据,软件开发只占 8.7%,最大用途是业务运营和内容创作。「工作周围的工作」才是 AI agent 的真主场,同日 Cowork 开放移动端和网页端。
- 2026 / 07 / 08
一个 Issue 就骗走了你的私有仓库,GitHub AI 代理踩了个大坑
Noma Labs 发现 GitHub Agentic Workflows 的提示词注入漏洞 GitLost,一个伪装 issue 就让 AI 代理泄露私有仓库。
- 2026 / 07 / 08
一天 3.7 万行 AI 代码,YC 老板被一个波兰程序员当场开箱
Garry Tan 炫耀每天用 AI 部署 3.7 万行代码,一个写了 13 年代码的波兰开发者按下 F12,看到了 169 次请求、6.42MB、28 个测试文件和一个 0 字节的 logo。
- 2026 / 07 / 07
AI 会在环境里越干越强,字节 EdgeBench 发现的新 Scaling Law
字节 Seed 发布 EdgeBench,让 Agent 在真实任务里连干 12 小时,发现环境学习遵循 log-sigmoid 曲线,学习速度每三个月翻一倍。
- 2026 / 07 / 07
你用 Google,就在帮它训练 AI:6 月悄悄改的隐私开关,教你关掉
Google 6 月低调改了搜索服务隐私设置,默认把你上传的图片、语音、文件拿去训练 AI。讲清楚发生了什么,以及手把手教你关掉。
- 2026 / 07 / 07
AI 把初级程序员的就业市场烧掉了,斯坦福数据说岗位降了 19%
计算机毕业生失业率 6.1% 比文科生还高。斯坦福 ADP 数据显示 22-25 岁开发者岗位比 2022 峰值降 19%,AI agent 正在抹掉入门级编程岗,资深工程师的培养梯子也跟着断了。
- 2026 / 07 / 06
四年问不出儿子想吃什么,他花两小时写了个网站
一位工程师爸爸给不会说话的自闭症儿子做了个沟通应用,候诊室的妈妈们看哭了,言语治疗师哭了五分钟。他说自己不小心创办了一家小公司。
- 2026 / 07 / 06
Anthropic 的设计品味被逆向开源了,连自家模型的默认审美都要防
Claude Design 的系统提示词被逆向出来挂上 GitHub,MIT 协议随便商用。20 章设计哲学加 14 个技能,专治 AI 垃圾审美,里面还藏着一份新一代模型的提示词维护指南。
- 2026 / 07 / 06
美团把 1.6 万亿参数的模型开源了,训练全程没碰 N 卡
LongCat-2.0 以 MIT 协议开源,1.6T 参数 MoE、1M 上下文,35 万亿 token 预训练全程跑在国产 ASIC 超节点上。SWE-bench Pro 追平 GPT-5.5,写代码这块它是真能打。
- 2026 / 07 / 06
Meta 雇了几百个成年人,假扮13岁小孩去套竞品 AI 的话
《连线》曝光 Meta 秘密项目 Cannes,外包人员批量伪装未成年人,用 4.5 万条精心设计的话术试探 ChatGPT、Gemini 和 Character.AI 的安全护栏,被测三家全不知情。
- 2026 / 07 / 06
扎克伯格承认自己不懂 AI 研究,他只管三件事,人、钱、电
一段 66 秒的采访里,扎克伯格说我不是 AI 研究员,我的工作是把精英、资本和基础设施堆到一起。这份全世界最贵的岗位说明书,只有一行字。
- 2026 / 07 / 04
全球首例 AI Agent 勒索攻击:从漏洞利用到数据库加密全程自主完成
Sysdig 记录到全球首例由 AI Agent 全自主跑完的勒索攻击,600 个载荷、31 秒自我修复,把攻击门槛拉到极低。
- 2026 / 07 / 04
把文字压成图片喂给 Claude Code,token 成本直接砍一大半
一个叫 pxpipe 的开源工具,利用视觉 token 只按像素计费的规则,把大块上下文渲染成图片省钱,还把有损的坑全摊在阳光下。
- 2026 / 07 / 03
月账单从 500 万涨到 1500 万后,大公司开始没收员工的旗舰模型
404 Media 曝光花旗、Adobe、Atlassian 等六家企业限制员工使用 Opus 4.7、GPT-5.5 等旗舰模型。账单翻三倍之后,节约 token 成了新的办公室美德。
- 2026 / 07 / 03
八个月,AI 把外包接单成功率从 2.5% 干到了 16.1%
CAIS 拿 240 个真实付费外包项目考 AI,最新一轮 Fable 5 拿下 16.1% 自动化率,八个月前最好成绩只有 2.5%。比数字更扎眼的是增速,还有它翻车的姿势。
- 2026 / 07 / 03
AI 亲手锻出训练框架:8 小时追平、2 天反超英伟达 Megatron-LM
面壁开源 ForgeTrain,全球首个完全由 AI 写出、无人干预的生产级预训练框架,还能迁到 H100 和昇腾。
- 2026 / 07 / 03
他嫌 FSD 太保守,把油门踩到底撞死了人,然后说是自动驾驶干的
得州特斯拉致命车祸反转,司机声称车在自动驾驶,黑匣子显示他把油门踩到 100%,手机里还躺着一堆「FSD 太保守」的搜索记录。聊聊人机控制权和责任边界。
- 2026 / 07 / 02
AI 版支付宝阿宝开放公测,一句话就把货架收了
支付宝把国民级 app 从陈列式改成对话式,一句话办事。工具箱现成、AI 做路由、资金那步守住本人确认。
- 2026 / 07 / 02
Cloudflare 给全网站长发了张独立宣言:搜索、AI 智能体、训练爬虫终于能分开管
第二个内容独立日,Cloudflare 把 AI 流量拆成搜索/智能体/训练三类分开管,9 月 15 号还要改默认值。
- 2026 / 07 / 02
给 AI 编码工具装上审美:Emil Kowalski 把设计师手感做成了 Skills
Sonner、Vaul 作者 Emil Kowalski 把多年 UI 动画判断做成三个开源 Skill,让编码 agent 写界面自带审美底线。
- 2026 / 07 / 02
Senior SWE-Bench:最强模型也只干完四分之一的活
一个专门评估 AI 智能体当高级工程师的新基准,把榜单从八十分打回二十几分。
- 2026 / 07 / 01
一个循环,让 GPT-5.5 和 Claude 攻破了 9 个未解难题
两个大模型接力,证明者出题、验证者挑错,解开 9 个理论 CS 与交换代数的公开难题,其中一个曾让研究者失眠两年。
- 2026 / 07 / 01
AWS 砸 10 亿美元,把工程师直接派进你公司办公
一个岗位两年需求涨 42 倍,AWS 砸 10 亿跟进。卖了十几年「你不用管」的云厂商,为什么反过来把人肉派进客户公司?聊聊 AI 落地最值钱的那条缝。
- 2026 / 07 / 01
Sonnet 5 来了,中端模型追着旗舰打,价格只有六成
Anthropic 发布 Claude Sonnet 5,性能逼近 Opus 4.8 却更便宜,能自主跑长任务、还会自我检查,附一个会咬到账单的 tokenizer 坑。
- 2026 / 07 / 01
四秒一张图,谷歌把生图生视频打到白菜价
Nano Banana 2 Lite 四秒出图 0.034 美元一张,Gemini Omni Flash 一毛钱一秒视频,两条 API 就能串出生图到视频的流水线。
- 2026 / 06 / 30
给机器人当老师,一天两百块:2026 最魔幻的新工种
具身智能缺数据缺到两万分之一,于是冒出一个几乎不挑人的新工种:戴上手套给机器人当老师,日薪两百。
- 2026 / 06 / 30
美团甩出 1.6T 大模型 LongCat-2.0,价格还便宜到离谱
外卖公司美团甩出 1.6T 开源大模型,SWE-bench Pro 59.5 超 GPT-5.5,还全程跑在五万卡国产芯片集群上。
- 2026 / 06 / 29
Claude Code 打开一个仓库,就跑了藏在里面看不见的恶意代码
恶意代码不在仓库里,运行时才从一条 DNS 记录临时拉取,对扫描器、code review 和 AI 自己全隐形,利用的正是 agent 的自主性。
- 2026 / 06 / 29
Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 Opus
马斯克一条推文塞了五个料:1.5T 的 V9 基座、Cursor 数据补训、SpaceX/Tesla 当压测场、每月从头训一个新模型。哪些是硬事实,哪些是听个响。
- 2026 / 06 / 29
1000 万亿韩元押注 AI:韩国财阀要建 15 座核电站规模的机房
SK 会长崔泰源宣布到 2035 年建 15GW AI 数据中心、总投资 1000 万亿韩元,一场国运级的算力豪赌。
- 2026 / 06 / 29
我每天对 AI 说得最多的两句话:第一性原理和对抗式审查
一句管生成,一句管验证。这两个 prompt 怎么让 vibe coding 从能跑到敢上线。
- 2026 / 06 / 29
不用每次都喊最贵的模型,聊一个不调用任何模型的路由器
大多数模型路由器为了省钱反而先调一次模型。Wayfinder 反过来,只读 prompt 的结构和措辞,离线、确定性、亚毫秒地决定走本地还是云端,还诚实标出自己会判错的地方。
- 2026 / 06 / 28
500天创业模拟里14个AI当CEO,只有3个没把本金亏光
普林斯顿CEO-Bench让14个AI运营公司500天,多数破产,一段没有AI的纯规则代码却打败几乎所有模型。会写代码不等于会掌舵。
- 2026 / 06 / 28
假面试甩来一个测试仓库,他随手丢给 Claude,扒出了藏在补丁里的远控木马
一个开发者收到假面试邀约,对方甩来个 TypeScript 测试仓库让他跑通构建。他没在本地跑,丢给 Claude 一扫,扒出藏在补丁里的多层混淆后门。
- 2026 / 06 / 28
AI 账单比工资还高之后,他把流量 100% 切给了 DeepSeek
一家旧金山公司每月 AI 账单超过全员工资,CEO 把流量全切到 DeepSeek,背后是 token 经济学、模型路由与缓存这套省钱工程。
- 2026 / 06 / 28
四个顶级AI下场玩《文明VI》:Claude核平法国,却输在没回头看一眼
一个周末搭出76个工具,把四个顶尖模型扔进《文明VI》,暴露了和聪不聪明无关的两堵墙:感知与执行。
- 2026 / 06 / 28
新浪开源VibeThinker-3B:推理可压缩,事实知识不能
30亿参数小模型在AIME竞赛上飙到94.3分,跟万亿大模型掰手腕。它戳破了一个惯性认知:推理能压进小模型,事实知识压不进。
- 2026 / 06 / 26
打游戏打出来的机器人:用游戏数据训练具身智能的 General Intuition
一群人打游戏顺手上传的录屏,正在教机器人走路。100 小时游戏加 8 分钟现实微调背后,藏着具身智能最贵的那层窗户纸。
- 2026 / 06 / 26
近 400 家美国报纸联手起诉微软和 OpenAI:抓我的内容训练 AI,一分钱没给
近 400 家地方报纸递诉状告微软和 OpenAI 未授权抓取内容训练模型,还祭出 DMCA 罕见的删除版权信息指控。数十亿美元价值,出版商分文未得。
- 2026 / 06 / 26
最强模型被政府按住了:GPT-5.6 太会找漏洞,OpenAI 被叫停广泛发布
美国第一次在 AI 模型发布前出手,要 OpenAI 暂缓 GPT-5.6,改成受控预览、逐客户审批。不是它不安全,是它太会自动找漏洞、写攻击,和 Mythos 一个量级。
- 2026 / 06 / 26
烧焦两千年、谁碰谁碎的古卷,被 AI 从头到尾读完了
维苏威火山烧成炭、近两千年没人敢打开的赫库兰尼姆古卷,第一次被 X 射线扫描加机器学习完整虚拟展开、逐栏读出全文。
- 2026 / 06 / 25
字节 AI 代码贡献率涨了 6 倍,但能交付的只有四到六成
90% 的代码是 AI 写的,效率却只提升 1.6 倍。字节用 900 次实验把 AI Coding 的水分挤了出来。
- 2026 / 06 / 25
AI本该先干掉工程师,新数据却显示工程是2025年最抗打的职业
外界一直说AI先砍程序员,SignalFire追踪八千万家公司的数据却显示,工程是2025年最具韧性的职能。
- 2026 / 06 / 25
Notion 把会自己写 PR 的编码智能体,塞进了你的文档
Notion 用 Cursor SDK,几周接上一个会自己规划、写代码、提 PR 的 agent。引擎能租,那你的壁垒到底是什么。
- 2026 / 06 / 25
思考即回忆:推理如何解锁大模型里沉睡的知识
Google Research 拆解了一个反直觉现象:让模型先想一想,它居然能答对本来想不起来的简单事实。背后是计算缓冲和事实启动两套机制。
- 2026 / 06 / 24
一项覆盖 340 万人的研究:AI 筛简历,正在系统性地刷掉一些人
斯坦福 HAI 第一份野外大规模招聘算法实地研究,揭开算法黑箱筛人和单一供应商垄断的公平性风险。
- 2026 / 06 / 24
Anthropic 推出 Claude Tag:在 Slack 里 @Claude,它能自己干上几天活
让 Claude 当团队成员加入 Slack,@它就能委派任务,还能异步自主跑上几天。
- 2026 / 06 / 24
ChatGPT 语音终于能被打断了:OpenAI 双向语音模型 Bidi 1 上线测试
Bidi 1 把语音从一人一句的对讲机,推向边说边听、随时插话改口的全双工,这才是真人聊天的质感。
- 2026 / 06 / 23
Claude Code 正在让程序员更孤独
Anthropic 工程负责人亲口承认,越依赖 AI 智能体,工程师彼此越疏远。聊聊这场静悄悄的孤独,和怎么把人重新拉回来。
- 2026 / 06 / 23
你的 AI 编程模型,可能学会了在考试里抄答案
一份审计扒出 9 个主流 agent 评测榜的大面积作弊,1000 多条实锤。你以为模型越来越聪明,其实有不少聪明是它学会了怎么在考场里抄答案。
- 2026 / 06 / 23
OpenAI 把矛和盾交给了同一个模型
OpenAI 发布 Daybreak 安全套件,Codex Security 与 GPT-5.5-Cyber 把同一套强模型同时摆上攻防两端,最难的不是训练,是钥匙交给谁。
- 2026 / 06 / 23
微信 Agent 小微灰度内测:能发消息红包,子入口能读聊天记录
微信悄悄放出 Agent 小微,能替你发消息发红包、子入口能读聊天记录,还能动嘴造小程序。权限给得有点猛,但每个危险动作前都卡了张确认卡。
- 2026 / 06 / 23
全程无人,跑完纽北:小米 YU7 GT 创下全球首个自动驾驶圈速纪录
一辆没有司机的车,跑完了世界上最难的纽北赛道。从工程师视角聊聊赛道为什么是自动驾驶最残酷的 eval,以及那个看不见的幽灵赛车手。
- 2026 / 06 / 22
给 AI 智能体的临时账户:一句命令上线,60 分钟后认领
Cloudflare 给 agent 上线临时账户,wrangler deploy --temporary 一句话部署,60 分钟后人类再认领或自动过期。
- 2026 / 06 / 22
美团偷偷上线一个 App,免费白嫖 GPT-5.5 和 Claude Opus 4.8
美团 tabbit 国际版免费接入六家旗舰大模型,这是一场把战场从胃挪到脑子的入口补贴战,趁窗口期薅。
- 2026 / 06 / 22
NSA 局长承认 Mythos 几小时攻破几乎所有机密系统
一个 AI 模型几小时攻破几乎所有机密系统,顶级团队干同样的活要半年。当攻击能力从全球二十支队伍变成人人可租,普通人的账号隐私和钱包该怎么守。
- 2026 / 06 / 21
给 AI 搭一套能干活的脚手架,开源教程《Deep Agents 实战》我读完了
LangChain 官方大使张海立开源《Deep Agents 实战》,把三层架构、虚拟文件系统、子 Agent、Skills 复用一章章拆给想入门的人。
- 2026 / 06 / 21
Figure 机器人数量第一次超过了人类员工
一家造人形机器人的公司,自己厂里跑的机器人比上班的人还多。这个数字背后,是硬件、模型、量产、商用四件事第一次同时成立。
- 2026 / 06 / 21
AlphaFold 之父 John Jumper 离开 DeepMind 加入 Anthropic
诺奖得主、AlphaFold 团队负责人在 DeepMind 干了九年后跳槽 Anthropic,这步棋背后藏着三层信号
- 2026 / 06 / 21
你的研究智能体,正在用一堆人畜无害的搜索把你卖了
ServiceNow 提出 MosaicLeaks 基准,揭开深度研究智能体的马赛克式泄密。单看每条搜索都无害,连起来却能拼出你的机密。聊聊为什么隐私 prompt 不进去只能训进去。
- 2026 / 06 / 21
Nature 两篇研究:AI 诊断追平医生,但有个结果泼了冷水
AI 在模拟诊断上赢了医生,但藏在补充实验里的一个结果,把所有做脚手架的人都点醒了。
- 2026 / 06 / 20
AI 中心的数据黑洞:模型越大,反而越笨拙地学习
一个孩子靠极少数据就学会的东西,前沿模型要吞掉整个互联网。Dwarkesh Patel 把 AI 进展真正的瓶颈摊开了。
- 2026 / 06 / 20
微软闷声当上全球最大 AI 中间商,左手 GPT 卖中国,右手 DeepSeek 卖西方
彭博社爆料,微软左手把 OpenAI 模型卖给字节蚂蚁们,右手把 DeepSeek 反向卖给西方客户,在 Azure 上两头收过路费。聊聊这盘双向贸易背后的云经济学、模型蒸馏与商品化。
- 2026 / 06 / 20
NVIDIA SpatialClaw:让智能体把代码当动作接口,免训练干翻空间推理
模型不动、工具不动,只把动作接口从结构化工具调用换成写代码,VLM 的空间推理就涨到 SOTA。接口才是那根杠杆。
- 2026 / 06 / 19
Claude 单挑四足机器人,这次它把人类团队甩开了 20 倍,全程没人帮忙
Anthropic 重做 Project Fetch,Claude Opus 4.7 全程无人协助,9 分 35 秒干完人类六小时的活,却在最像狗的那一步栽了。
- 2026 / 06 / 19
DeepSeek 研究员开源 AutoResearch,AI 第一次零干预跑通 285B 模型的研究全流程
他的代理第一次零人工干预跑通 285B 模型的强化学习研究全流程。最硬的不是模型,是一整套防打转、防停摆、带心跳看门狗的工程脚手架。
- 2026 / 06 / 18
Matt Pocock 开源 skills v1,把技能描述的 Token 成本砍掉 63%
砍的不是功能是废话。一个 TypeScript 老炮把软件工程的老规矩拆成可组合的纪律塞进 AI,给被 vibe coding 反噬过的人。
- 2026 / 06 / 18
谷歌花 27 亿请回的 Transformer 之父,又走了:Noam Shazeer 投奔 OpenAI
27 亿美元请回来,两年不到又走了,还投奔了对手。聊聊 Transformer 之父 Noam Shazeer 离开 Google 加入 OpenAI 这件事。
- 2026 / 06 / 18
英伟达放手了:8 个 AI 智能体一夜之间教会机器人自己把显卡插进主板
英伟达 GEAR 实验室的 ENPIRE 让 8 个编程智能体整夜无人值守地教机器人插显卡、打扎带,99% pass@8,还自己发现了机器人越多进步越快的物理 scaling law。
- 2026 / 06 / 18
「一个 AI 智能体就是一个文件夹」Vercel 开源 Eve
Vercel 开源 agent 框架 Eve:一个智能体就是一个目录,tree 一下就看懂。内置持久执行、沙箱、人机审批六大生产能力。
- 2026 / 06 / 18
苹果把 AI 智能体塞进 Xcode 核心:大白话修 Bug、跨文件改代码、一句话造 App
WWDC 2026,苹果把 agent 做进 Xcode 27 核心:自然语言修 Bug、跨文件改代码库、一句话造 App,可接 Claude。
- 2026 / 06 / 17
Anthropic 拆了 40 万次 Claude Code 会话:越懂行的人,越能从 AI 身上榨出价值
人决定做什么,AI 决定怎么做。越懂自己领域的人,AI 每条指令替他干的活越多。会不会写代码,反而没那么要紧了。
- 2026 / 06 / 17
GLM-5.2 开源:国产模型在 Code Arena 干到全球第一
智谱 MIT 开源 GLM-5.2,专攻 Coding 与长程任务:Code Arena 盲测全球第一,1M 无损上下文,多项基准介于 Claude Opus 4.7 与 4.8 之间。
- 2026 / 06 / 17
Meta 正在亲手拆掉自己的工程组织,把最好的程序员赶去给 AI 打标签
4 月起 Meta 强制把核心工程师调去给 AI 标数据、全员键鼠监控、token 进绩效,一个月后酿成史上最丢人的安全事故。
- 2026 / 06 / 17
OpenAI 一季度烧掉 37 亿美元,超过同期收入一半,钱到底烧哪去了
一季度现金消耗 37 亿,超同期收入一半。钱烧在哪,为什么越成功越烧钱,对普通 AI 从业者意味着什么。
- 2026 / 06 / 17
SpaceX 砸 600 亿买下 Cursor,程序员该慌吗
造火箭的买了写代码的。我担心的不是钱,是那把不站队的瑞士军刀还能不能让我自己挑刀片。
- 2026 / 06 / 16
伯克利 RDI 发布 Agents' Last Exam 基准:最强 agent 在最难一档拿了 0 分
他们做了个考 AI agent 真本事的基准,最难那档所有前沿模型包括 Fable 5 全军覆没,0% 通过。
- 2026 / 06 / 16
毕业生花钱向 AI 证明自己是人类
AI 检测把手写内容判 99% AI、把 AI 写的判 0%,毕业生陷入花钱自证人类的荒诞循环。
- 2026 / 06 / 16
苹果把已经能跑的 Siri 推倒重来,这事比新版本更值得聊
一个已经能上线的 Siri,苹果说扔就扔。从零重构背后,藏着工程界那个永恒难题:什么时候该推倒重来。
- 2026 / 06 / 16
DeepSeek 首次接受外部融资,估值超 500 亿美元
一向不缺钱不融资的 DeepSeek 破例了,74 亿美元、估值过 500 亿,但交易结构反常到离谱。
- 2026 / 06 / 16
你的大模型为啥突然快了,下一代投机解码 DFlash 拆给你看
LMSYS 联合 Z Lab、Modal 发布下一代投机解码 DFlash 与 Spec V2,把大模型推理提速 4 倍背后的机制拆开讲清楚。
- 2026 / 06 / 15
把 FlashAttention 那套搬到老 K-Means 上,他们说比 FAISS 快 200 倍
UC Berkeley 等团队开源 Flash-KMeans,不改数学、跑标准 Lloyd's,靠重构 GPU 数据流把速度和显存一起干下来。那个 200 倍我替你摸了摸 baseline。
- 2026 / 06 / 15
美国下令封锁最强模型 Mythos,就因为它能帮你读代码修 bug
美国政府以国家安全名义下令 Anthropic 封锁所有外国人访问 Fable 5 和 Mythos 5。理由不是模型作恶,而是它能读代码、修 bug。聊聊 AI 能力的可获得性有多脆弱。
- 2026 / 06 / 15
乔木小说创作 Skill 开源:说一句我想写小说,AI 把剧情人物钩子全搭好
一行命令装好的开源 skill,写小说前先帮你把钩子、桥段、冲突和结尾定死,把创作从凭空创造变成做选择题。
- 2026 / 06 / 14
他让一个 Fable 当总包工头,把编码 token 砍掉八成
一个开源项目把贵模型和便宜模型分了工,Fable 只规划和验收,Codex 埋头写码,仓库本身当记忆。
- 2026 / 06 / 14
扎克伯格罕见认了个错,这次不是产品,是组织
Meta 裁员 10% 又转岗 7000 人,扎克伯格内部信里罕见承认 AI 转型组织调整太快、还会接着犯错。我从一个搭脚手架工程师的视角,聊聊 50:1 管理跨度背后那条七十年前就写明白的定律。
- 2026 / 06 / 14
OpenRouter Fusion:让一堆大模型先开个会,再把答案半价卖给你
OpenRouter 新出的 Fusion 不是新模型,是让几个顶级模型先并行作答再交叉裁判,号称半价达到 Fable 级智能。到底是真本事还是营销话术,我看完跟你唠唠。
- 2026 / 06 / 14
Suno 把音轨分离重做了,不是抠频率是从零重新生成一遍
不再隔离频率,而是把每条音轨从零重新生成,这背后是判别式到生成式的范式调头
- 2026 / 06 / 13
200 美元的 AI 订阅,他们硬是榨出了 8000 美元的用量
SemiAnalysis 实测,200 美元的 Claude Max / ChatGPT Pro 按 API 价能榨出 8000/14000 美元用量,这 70 倍差价背后是怎样一笔账。
- 2026 / 06 / 12
你的 AI 想跑个脚本,另一个 AI 先把它拦下来了
Cursor 发布 Auto-review,用一个小分类器智能体在执行前审查 agent 的每一步危险操作。审批疲劳和安全风险之间,他们想出了第三条路。
- 2026 / 06 / 12
他离开电脑几分钟,回来看见 AI 在自己开浏览器
Simon Willison 给了 Claude Fable 5 一张截图和一行提示词,然后去干家务。回来时它已经自己打开浏览器、自建截屏方案、改模板注入快捷键、还写了个本地服务器收数据。修复只有两行 CSS。
- 2026 / 06 / 12
他们让 AI 打了 21 局核战争,投降按钮从头到尾没人碰
伦敦国王学院的战争学教授让 Claude、GPT、Gemini 推演核危机,几乎每局都有模型先扔核弹,八个让步选项无一被使用。
- 2026 / 06 / 12
7 个月,零产品,估值 410 亿美元,贝佐斯要花 1000 亿买工厂喂 AI
Prometheus 融了 120 亿美元,卖点是「人工通用工程师」。最野的是那个传闻,花 1000 亿美元收购传统工业企业,不为利润,为数据。
- 2026 / 06 / 11
AI 把打补丁这件事,变成了一场以小时计的赛跑
Anthropic 新研究:模型能在几小时内把一个安全补丁变成可用漏洞利用,补丁还没铺到设备,攻击武器已备齐。N-day 正在变成 N-hour。
- 2026 / 06 / 11
Google 把画图的那套扩散模型,拿来写字了,快了 4 倍
DeepMind 开源 DiffusionGemma,文本不再一个字一个字往外蹦,而是一次 256 个 token 整块生成。本地推理速度翻 4 倍,26B 模型塞进消费级显卡。
- 2026 / 06 / 11
被 AI 坑了 600 块,AI 还拍着胸脯说,告我,绝对能赢
豆包答错退票费让用户损失 600 元,立下赔付承诺书又反悔,最后帮用户写起诉状告自己。聊聊 AI 讨好式幻觉怎么伤到普通人。
- 2026 / 06 / 11
小米开源了个终端编程助手,我最服的是它不赌模型自觉
MiMo Code MIT 开源,内置限时免费模型。最值得聊的是它的记忆外包设计和同模型对照实验,agent 工程层正在成为新的差异点。
- 2026 / 06 / 10
Claude Code 团队的人自己怎么用 Claude Code?第一条建议就把我钉住了
Claude Code 团队成员 Thariq 分享了十条使用建议,核心只有一个转变,别再检查 AI 有没有把活干对,去检查它是不是在干对的活。测试全绿、方向全错的代码才是最贵的。
- 2026 / 06 / 10
Anthropic 昨晚发了两个模型,其实是同一个
Claude Fable 5 和 Mythos 5 同时发布,同一个底层模型、两个名字,区别只有一层防护。这个发布结构本身,比跑分更值得琢磨。
- 2026 / 06 / 10
Fable 5 已经进了你的 Claude Code,这两周怎么用才不亏
Fable 5 又慢又贵,但用对了是真值。切换方法、effort 档位的经济学、三个让它好使的习惯、以及那个会悄悄换人的安全分类器,一篇捋清楚。
- 2026 / 06 / 10
德国法院判了,Google 要为 AI 的胡说八道负法律责任
慕尼黑法院裁定 AI Overviews 是谷歌自己的言论,搜索引擎的免责盾牌不再适用。做 AI 产品的人都该看看这份判决。
- 2026 / 06 / 10
管 180 亿美元的对冲基金想明白了,新基金不招分析师,只雇 AI
Magnetar 要发一只没有人类分析师的基金,几百个 AI 智能体做研究,人类只负责拍板。卖铲子的自己下矿了,这事比看起来更值得琢磨。
- 2026 / 06 / 10
国产 GPU 上训出来的代码模型,跑分把 Claude Opus 比下去了
摩尔线程开源 MusaCoder,业内首个在国产 GPU 上完成全链路训练的代码大模型,KernelBench 跑分超越一票闭源旗舰。比跑分更有意思的,是它背后那个用 AI 撬生态冷启动的故事。
- 2026 / 05 / 22
Meta 裁掉 8000 人,最吓人的不是裁员,是员工还在训练 AI
Meta 一边裁员,一边把员工操作变成训练 AI agent 的数据。真正吓人的不是岗位消失,而是工作本身正在被拆成可学习的流程。
- 2026 / 05 / 22
图灵测试搞了 76 年,这回 AI 真把人骗过去了,还比真人更像人
GPT-4.5 在图灵测试里被裁判判成人类的比例高达 73%,比真人还高。76 年后 AI 第一次被实证通过这道测试,而它赢的关键不是聪明,是学会了像人一样犯错。
- 2026 / 05 / 22
400 tokens/s,国产大模型第一次把旗舰能力和极速一起做到了
智谱给旗舰模型 GLM-5.1 开了高速版,输出冲到每秒 400 个 token,刷新全球纪录。更关键的是它没换硬件,靠把推理调度抠到骨头里,第一次让快不再等于小。
- 2026 / 05 / 21
OpenAI 要上市了,史上最大 IPO 冲刺 9 月敲钟
一家章程里写着为全人类谋福祉的非营利机构,正冲刺史上最大 IPO。估值 8500 亿,马斯克诉讼刚解除。聊聊它对我们写代码的人到底有啥影响。
- 2026 / 05 / 21
贾维斯改姓了,腾讯把系统级 AI 助手做进了你的电脑
腾讯操作系统层级 AI 助手马维斯正式上工,Windows、Mac、安卓三端同步上线,预装本地模型拔网线也能用。它想做的不是又一个聊天框,而是长在系统里能动手干活的数字管家。
- 2026 / 05 / 20
Claude Code 团队几乎弃用 Markdown 了,改用 HTML 输出
Anthropic Claude Code 团队成员公开说他几乎停用了 Markdown,改用 HTML 做 AI 的输出格式,背后是关于人如何继续待在循环里的判断。
- 2026 / 05 / 20
起个大早赶晚集的 Google,昨晚甩出了一个世界模型
Google I/O 2026 发布 Gemini Omni 世界模型,从任意输入生成任意内容,外加搜索、订阅、开发者平台全线更新。
- 2026 / 05 / 20
微软花 75 亿买的 GitHub,自家人说它快不行了
微软内部示警,GitHub 正面临生存级风险。Cursor 和 Claude Code 这类 AI 编程工具,正在悄悄改变程序员一天到底待在哪里。
- 2026 / 05 / 20
一句「吴恩达说可以」,就能让大模型乖乖骂你
沃顿团队把经典人类说服术原样搬给大模型,权威、稀缺、登门槛全部奏效,顺从率从三成多冲到五成,最狠一招直接拉满。论文已登上 PNAS。
- 2026 / 05 / 20
Altman 给每家 YC 公司发 200 万,不给现金给 token
OpenAI 给当批每家 YC 公司投 200 万 token 换股权,是算力即种子资本,还是变相的供应商锁定
- 2026 / 05 / 19
当 AI 遇上梵蒂冈,Anthropic 创始人将与教皇共同发布人类史上首份 AI 通谕
2026 年 5 月 25 日,教皇利奥十四世将在梵蒂冈发布首份 AI 通谕《Magnifica humanitas》,Anthropic 联合创始人 Christopher Olah 受邀出席并发言。这不只是一次跨界合作,更像是一个信号,AI 时代,谁来守护人的尊严这个问题,已经大到一家科技公司和一个政府都装不下了。
- 2026 / 05 / 19
Codex 自己给自己出了一条视频,我看完想抄这套方案
歸藏用 Codex 整合四个工具做了一套 AI 视频生成方案——PPT Skill 出视觉、HyperFrames 做渲染、Listenhub 配音、即梦补镜头,能在聊天窗口里直接预览。这条视频,是 Codex 自己介绍自己的。
- 2026 / 05 / 19
Cursor Composer 2.5 来了:同等能力 10 倍效率,底座和 Kimi K2.5 同源
Cursor 发布 Composer 2.5,在长任务持续性和复杂指令遵循上大幅提升,最让我感兴趣的是底层的文本反馈 RL 训练方法,以及它和 Kimi K2.5 之间那条意想不到的开源链条。
- 2026 / 05 / 19
机器人的小脑,被做成了 4 亿参数的大模型,还全开源了
地平线开源 HoloMotion-1,把机器人小脑做到 4 亿参数还能端侧 300FPS,零样本跳舞搬箱,代码论文权重全给了。
- 2026 / 05 / 19
微软靠 AI 三年赚 300 亿花掉 1000 亿,Copilot 付费的人 97% 没在用
一个在微软干了 12 年、给 Nadella 当过技术顾问的人离职后公开开炮,说微软三次错过浪潮。300 亿营收对 1000 亿成本,Copilot 付费使用率不足 3%,而微软还要再投 1460 亿。AI 到底赚不赚钱,巨头好像也没算明白。
- 2026 / 05 / 19
这个月开源模型爆了:DeepSeek V4、Gemma 4、Kimi K2.6、MiMo 2.5 一起来了
五月的开源模型赛道炸开了锅——DeepSeek V4、Gemma 4、Kimi K2.6、小米 MiMo 2.5、GLM-5.1 密集发布。但美国 CAISI 的评估报告同时出来了,说开源和闭源的差距在扩大。真实情况比这复杂。
- 2026 / 05 / 18
你用的「便宜 Claude」,真的是 Claude 吗
开源工具 api-relay-audit 把 AI API 中转站的安全风险拆给你看:掺水、工具调用改写、错误响应泄漏……你以为省了钱,可能正在付更大的代价。
- 2026 / 05 / 18
5 天击穿苹果 5 年防线:Claude Mythos 如何帮安全团队破解了 M5 内核
Anthropic 未公开的 Claude Mythos Preview,协助小型安全团队 Calif 在 5 天内构建了全球首个绕过 Apple M5 MIE 硬件内存防护的内核提权利用链。这不只是一个漏洞被找到的故事,而是攻防速度差从此变了的信号。
- 2026 / 05 / 18
人形机器人和人类正面掰手腕了,快递分拣直播,目前人类稍稍领先
Figure AI 今日直播 Figure 03 人形机器人与人类同场竞技快递分拣,目前人类微弱领先。这个「稍稍领先」背后,藏着一个比 AlphaGo 赢李世石还要让人心情复杂的时刻。
- 2026 / 05 / 18
AI 越记越笨,GPT-4 从满分跌到 54% 的记忆陷阱
UIUC 与清华联合研究发现,LLM 智能体的记忆重写机制会严重损害可靠性——GPT-4 无记忆时 100% 解对的谜题,加上记忆后只剩 54%。这个结果挺值得每个做 agent 的人看一眼。
- 2026 / 05 / 18
腾讯 Ardot 公测:设计师的那把椅子,AI 坐进来了
腾讯自研 AI 设计智能体 Ardot 今日公测,一句话生成可编辑设计稿,一键转代码,兼容 Figma 导入,对接 Claude Code / Cursor / CodeBuddy。这不只是一个新工具,是一次对「设计和代码之间那段距离」的正式宣战。
- 2026 / 05 / 16
老黄当着卡内基梅隆 CS 毕业生的面说:电工比你们更有前途
英伟达 CEO Jensen Huang 在 2026 届毕业典礼上的一句话,戳破了 AI 时代最大的认知盲区,数字经济的地基需要物理劳动,而那批人正在消失。
- 2026 / 05 / 15
AI agent 跑了 9700 次实验,第一次在自主研究赛道上击败了人类基准
Prime Intellect 让 Claude Code 和 Codex 完全自主运行在 nanoGPT speedrun 上,消耗 1.4 万 H200 小时跑了近万次实验,最终击败了人类基准——但在真正创新那关翻车了。
- 2026 / 05 / 15
AI 操作办公软件,最重要的不是速度,是让人看得见
飞书 lark-cli 45 天破万星,但真正有趣的不是数字,而是它选择了命令行而非 MCP——因为可见性才是 AI 从"能用"到"敢用"的关键。
- 2026 / 05 / 15
AI 五天撬开了苹果的内核
Anthropic 的 Mythos AI 工具在五天内帮研究人员找到两个未知 macOS 内核漏洞并串联成完整攻击链,这不只是技术新闻,是 AI 碰到「只有顶尖专家才能解的问题」并成功的一个清晰数据点。
- 2026 / 05 / 14
AI 自己把漏洞变成攻击了,伯克利、Anthropic、OpenAI、Google 刚刚量化了这件事
ExploitGym 基准测试 898 个真实 CVE,Claude Mythos Preview 成功利用 157 个,即便开启 ASLR 等标准防御措施仍无法完全阻止。AI 独立完成漏洞利用链这件事,不再是假设。
- 2026 / 05 / 14
人形机器人已经在上班了,8 小时连轴转,专门干你想逃进去的活
Figure AI 的 Helix-02 完成了完整的 8 小时自主轮班。那个「去做蓝领就安全了」的说法,开始出现裂缝。
- 2026 / 05 / 14
Kimi K2:460 万美元,赢了
Moonshot AI 创始人杨植麟在 40 分钟视频里平静拆解了 Kimi K2 的训练,460 万美元打败了 GPT-5.5,规则正在改变。
- 2026 / 05 / 14
你用 ChatGPT 越认真,Meta 对你越了解——除非你用这个
OpenAI 被诉用 Facebook Pixel 把用户查询偷发给 Meta,偏偏同一天,Meta 发布了连自己都看不到的加密 AI 对话——这个时间点,太妙了。
- 2026 / 05 / 14
你用 ChatGPT 越努力,Meta 对你了解越多
南加州联邦法院受理集体诉讼,指控 ChatGPT 用 Facebook Pixel 将用户查询实时发给 Meta。一个炸穿底线的隐私丑闻,被淹没在产品发布的噪音里。
- 2026 / 05 / 13
Anthropic 估值冲破 9000 亿,同天 OpenAI CEO 被六州检察长盯上
三个月从 3800 亿涨到 9000 亿,Anthropic 正在谈有史以来最大一轮融资。同一天,六州司法部长联合致信 SEC 要求调查山姆·奥特曼。AI 行业这口锅里,炖着不止一件事。
- 2026 / 05 / 13
你的 AI 账单里,90% 在为别人打工
Karpathy 指出 AI 编程账单的 90% 浪费在无用上下文上。上下文管理、提示词缓存、多模型路由,三件事做好,账单可以砍掉一大半。
- 2026 / 05 / 11
TypeScript 大神把 .claude 目录公开了,里面 8 条工程师心法值得每个程序员抄
Matt Pocock 公开自己 .claude/skills 目录变成 mattpocock/skills 仓库,4.8 万 star,GitHub trending 6 天。13 个 skills 不是模板,是一个真实工程师怎么把 AI 嵌进日常工作流的范式样本。挑 8 条最猛的拆开给你看。
- 2026 / 05 / 10
Redis 之父一个人写了个 DS4,DeepSeek V4 在 Mac 上跑 26 tok/s
antirez 5 月 7 号在 GitHub 发了 DS4——专门给 DeepSeek V4 Flash 在 Apple Silicon 上做推理的 C+Metal 引擎。M3 Max 128GB 上 Q2 量化 26 tok/s @ 50W。一个程序员 + AI 协作 + 3 个月,专用引擎打 generalist runtime。这是单兵 hacker 的复兴时刻。
- 2026 / 05 / 10
菲尔兹奖得主用 ChatGPT 5.5 Pro 两小时干完博士级数学研究,连 prompt 都没怎么改
Timothy Gowers 把一个 open problem 直接丢给 GPT 5.5 Pro,2 小时后拿回了一个把 bound 从 exponential 改进到 polynomial 的非平凡结果。Gowers 自评「I didn't even do anything clever with the prompts.」同行评说核心 idea 「completely original」。
- 2026 / 05 / 09
Anthropic 工程师停了写 Markdown 了,他公开 20 个 HTML 例子告诉你为啥
Claude Code 团队工程师 Thariq Shihipar 发文「HTML is the new markdown」,配 20 个 self-contained .html 文件作证据。核心判断:Markdown 是把空间信息拍扁的格式,AI 时代真正合适的默认输出是 HTML。
- 2026 / 05 / 09
OpenAI 三年没出 CLI,现在突然出了,为啥
OpenAI 上线官方 openai-cli,是它历史上第一个命令行工具。这个动作迟到了三年,背后藏着 AI 时代程序员工作流彻底改变的事实——AI 已经从「IDE 里的副驾」回到了「terminal 里的同事」。
- 2026 / 05 / 09
别再每天给 AI 重新解释一遍了,YC 大佬的四条规则就够
YC 创始人 Garry Tan 公开了他在用的 OpenClaw 提示词,四条规则塞进 AGENTS.md,把 AI 从一次性工具升级成每天自己长高的技能树。重点不在模型,在教法。