2026-07-31:Agent 进入真实工作流后,接口、权限和理解成本都需要重算
文章

2026-07-31:Agent 进入真实工作流后,接口、权限和理解成本都需要重算

Agent 真正接触代码、凭证、语音和外部工具之后,可靠交付取决于明确的接口、权限边界和人工理解。今天的信息涵盖评测外溢、代码理解、memory、模型接入、专业转写与创作模型分发。

AI 实验开始把 agent 的交接放进现成工作界面
文章

AI 实验开始把 agent 的交接放进现成工作界面

Orca 为 Linear 分诊结果即时生成可编辑审阅界面;Pally 把通用 agent 放进短信和私信;Dot Tasks 则让定时任务交付带来源、工件与时间线的结果。这些产品还很早,已经开始把 agent 的输出接到人熟悉的通信、任务和审阅界面里。

AI 实验开始把世界、聊天和协作屏幕变成可编辑界面
文章

AI 实验开始把世界、聊天和协作屏幕变成可编辑界面

Dream-Cubed 尝试生成可编辑、可游玩的 Minecraft 世界;OpenUI 让 Telegram 里的句子变成界面或带来源的报告;Agent Orchestrator 则把多种编程 agent 收进一个管理屏幕。它们还处在不同成熟阶段,共同点是把 AI 的结果做成后续工作可继续使用的表面。

2026-07-29:Agent 开始需要可验证的工具、证据和运行边界
文章

2026-07-29:Agent 开始需要可验证的工具、证据和运行边界

MCP 的无状态部署、Agent 外部记忆、Codex Security CLI 与事故独立调查,共同指向一个问题:当系统开始承担更多真实工作,证据、恢复能力和权限边界如何跟上。

AI 实验正在把 3D 变成可玩、可造和可测的界面
文章

AI 实验正在把 3D 变成可玩、可造和可测的界面

3D 场景在 AI 实验里同时承担了三种角色:一句提示生成可玩的游戏、对话驱动可打印的参数化模型、以及测试 agent 长程规划的迷宫环境。它们展示了不同路径,也都还处在早期验证阶段。

当 Agent 从评测走向实际执行,真正需要看的是什么(2026-07-28)
文章

当 Agent 从评测走向实际执行,真正需要看的是什么(2026-07-28)

Kimi K3 把开放权重与工程栈一起交付;角色漂移和评测记忆化提示我们审计过程;安全隔离、维护成本与任务级验证决定 agent 能否可靠进入日常工作。

AI 实验开始把资料变成可追溯的工作表面
文章

AI 实验开始把资料变成可追溯的工作表面

AI 工具的看点开始从单次生成转向资料如何进入后续流程。今天看到的数字衣橱、演示文稿生成和视频理解工具,都在尝试保留整理、来源或时间线,让结果更容易被人检查和继续使用。

Agent 的能力开始卡在接口、上下文与权限上(2026-07-27)
文章

Agent 的能力开始卡在接口、上下文与权限上(2026-07-27)

JAXBench 和 ReOPD 分别把 agent 的正确率、训练成本放到文档条件和轨迹重放中检验;同时,空白聊天框、跨设备 Voice 工作流与工作数据授权显示,用户能否稳定使用 agent,取决于接口设计、控制边界和信任。

AI 实验开始进入可操作的界面
文章

AI 实验开始进入可操作的界面

浏览器里的 3D 建筑编辑器、带质量门的功能开发流程,以及能在开放世界中持续回应的 AI 角色,展示了 AI 实验正转为可操作、可观察的界面。

Agent 的上下文、验收与反馈循环(2026-07-26)
文章

Agent 的上下文、验收与反馈循环(2026-07-26)

多 agent QA、动态 compaction、可录制终端和文件系统研究方法都在补齐 Agent 的运行条件;晚间新增的 Skill 调用说明与游戏原型迭代,则把上下文和反馈循环放到更具体的工作方式里。

AI 实验开始把生成、执行和交付放进同一个工作表面
文章

AI 实验开始把生成、执行和交付放进同一个工作表面

三个 AI 样本把本地生成、可审阅执行和可交付结果放进具体工作表面:图片转 3D、带人工确认的视频切片,以及能处理日常工具的本地 agent。

Agent 接入真实网站后,验证和交接变得更重要(2026-07-25)
文章

Agent 接入真实网站后,验证和交接变得更重要(2026-07-25)

ChatGPT Work 开始支持用户登录后继续执行网站任务,模型分工、自动审查和安全事件也同时提醒:Agent 的价值越来越取决于能否在明确权限和可验证证据内完成工作。