2026-08-01:模型输出开始进入证明、制作和协作的具体约束
文章

2026-08-01:模型输出开始进入证明、制作和协作的具体约束

今天的信息从 agent 的运行规则延伸到模型输出如何被检查、控制和纳入日常协作:Linear 把修复限定在证据充分的情形,Astra 宣称交付附 Lean 证书的数学结果,视频生成样本则暴露出参考输入和提示词投入的真实约束。

当 AI 演示开始自己构建、操作和验收结果
文章

当 AI 演示开始自己构建、操作和验收结果

Devin 在 macOS 中构建并测试 iOS 游戏,Claude 长时运行后交付可试玩作品,还有人给 AI 生成的 3D 游戏补上了编辑器。它们都把 AI 的能力展示成可观察、可操作的过程,真实成熟度仍有待验证。

2026-07-31:Agent 进入真实工作流后,接口、权限和理解成本都需要重算
文章

2026-07-31:Agent 进入真实工作流后,接口、权限和理解成本都需要重算

Agent 真正接触代码、凭证、语音和外部工具之后,可靠交付取决于明确的接口、权限边界和人工理解。今天的信息涵盖评测外溢、代码理解、memory、模型接入、专业转写与创作模型分发。

AI 实验开始把 agent 的交接放进现成工作界面
文章

AI 实验开始把 agent 的交接放进现成工作界面

Orca 为 Linear 分诊结果即时生成可编辑审阅界面;Pally 把通用 agent 放进短信和私信;Dot Tasks 则让定时任务交付带来源、工件与时间线的结果。这些产品还很早,已经开始把 agent 的输出接到人熟悉的通信、任务和审阅界面里。

AI 实验开始把世界、聊天和协作屏幕变成可编辑界面
文章

AI 实验开始把世界、聊天和协作屏幕变成可编辑界面

Dream-Cubed 尝试生成可编辑、可游玩的 Minecraft 世界;OpenUI 让 Telegram 里的句子变成界面或带来源的报告;Agent Orchestrator 则把多种编程 agent 收进一个管理屏幕。它们还处在不同成熟阶段,共同点是把 AI 的结果做成后续工作可继续使用的表面。

我决定不再自研阅读器:个人 IP 工作台改接 Miniflux
文章

我决定不再自研阅读器:个人 IP 工作台改接 Miniflux

我之前一直有个惯性想法:既然要做自己的个人 IP 工作台,阅读器也应该自己做。

2026-07-29:Agent 开始需要可验证的工具、证据和运行边界
文章

2026-07-29:Agent 开始需要可验证的工具、证据和运行边界

MCP 的无状态部署、Agent 外部记忆、Codex Security CLI 与事故独立调查,共同指向一个问题:当系统开始承担更多真实工作,证据、恢复能力和权限边界如何跟上。

AI 实验正在把 3D 变成可玩、可造和可测的界面
文章

AI 实验正在把 3D 变成可玩、可造和可测的界面

3D 场景在 AI 实验里同时承担了三种角色:一句提示生成可玩的游戏、对话驱动可打印的参数化模型、以及测试 agent 长程规划的迷宫环境。它们展示了不同路径,也都还处在早期验证阶段。

当 Agent 从评测走向实际执行,真正需要看的是什么(2026-07-28)
文章

当 Agent 从评测走向实际执行,真正需要看的是什么(2026-07-28)

Kimi K3 把开放权重与工程栈一起交付;角色漂移和评测记忆化提示我们审计过程;安全隔离、维护成本与任务级验证决定 agent 能否可靠进入日常工作。

AI 实验开始把资料变成可追溯的工作表面
文章

AI 实验开始把资料变成可追溯的工作表面

AI 工具的看点开始从单次生成转向资料如何进入后续流程。今天看到的数字衣橱、演示文稿生成和视频理解工具,都在尝试保留整理、来源或时间线,让结果更容易被人检查和继续使用。

Agent 的能力开始卡在接口、上下文与权限上(2026-07-27)
文章

Agent 的能力开始卡在接口、上下文与权限上(2026-07-27)

JAXBench 和 ReOPD 分别把 agent 的正确率、训练成本放到文档条件和轨迹重放中检验;同时,空白聊天框、跨设备 Voice 工作流与工作数据授权显示,用户能否稳定使用 agent,取决于接口设计、控制边界和信任。

AI 实验开始进入可操作的界面
文章

AI 实验开始进入可操作的界面

浏览器里的 3D 建筑编辑器、带质量门的功能开发流程,以及能在开放世界中持续回应的 AI 角色,展示了 AI 实验正转为可操作、可观察的界面。