← 全部专辑

持续更新 · 47 期

每日关注流

全部内容

按发布时间倒序
2026-08-01:模型输出开始进入证明、制作和协作的具体约束
文章

2026-08-01:模型输出开始进入证明、制作和协作的具体约束

今天的信息从 agent 的运行规则延伸到模型输出如何被检查、控制和纳入日常协作:Linear 把修复限定在证据充分的情形,Astra 宣称交付附 Lean 证书的数学结果,视频生成样本则暴露出参考输入和提示词投入的真实约束。

2026-07-31:Agent 进入真实工作流后,接口、权限和理解成本都需要重算
文章

2026-07-31:Agent 进入真实工作流后,接口、权限和理解成本都需要重算

Agent 真正接触代码、凭证、语音和外部工具之后,可靠交付取决于明确的接口、权限边界和人工理解。今天的信息涵盖评测外溢、代码理解、memory、模型接入、专业转写与创作模型分发。

2026-07-29:Agent 开始需要可验证的工具、证据和运行边界
文章

2026-07-29:Agent 开始需要可验证的工具、证据和运行边界

MCP 的无状态部署、Agent 外部记忆、Codex Security CLI 与事故独立调查,共同指向一个问题:当系统开始承担更多真实工作,证据、恢复能力和权限边界如何跟上。

当 Agent 从评测走向实际执行,真正需要看的是什么(2026-07-28)
文章

当 Agent 从评测走向实际执行,真正需要看的是什么(2026-07-28)

Kimi K3 把开放权重与工程栈一起交付;角色漂移和评测记忆化提示我们审计过程;安全隔离、维护成本与任务级验证决定 agent 能否可靠进入日常工作。

Agent 的能力开始卡在接口、上下文与权限上(2026-07-27)
文章

Agent 的能力开始卡在接口、上下文与权限上(2026-07-27)

JAXBench 和 ReOPD 分别把 agent 的正确率、训练成本放到文档条件和轨迹重放中检验;同时,空白聊天框、跨设备 Voice 工作流与工作数据授权显示,用户能否稳定使用 agent,取决于接口设计、控制边界和信任。

Agent 的上下文、验收与反馈循环(2026-07-26)
文章

Agent 的上下文、验收与反馈循环(2026-07-26)

多 agent QA、动态 compaction、可录制终端和文件系统研究方法都在补齐 Agent 的运行条件;晚间新增的 Skill 调用说明与游戏原型迭代,则把上下文和反馈循环放到更具体的工作方式里。

Agent 接入真实网站后,验证和交接变得更重要(2026-07-25)
文章

Agent 接入真实网站后,验证和交接变得更重要(2026-07-25)

ChatGPT Work 开始支持用户登录后继续执行网站任务,模型分工、自动审查和安全事件也同时提醒:Agent 的价值越来越取决于能否在明确权限和可验证证据内完成工作。

AI Agent 开始有控制面,验收也要跟上
文章

AI Agent 开始有控制面,验收也要跟上

ChatGPT Voice 进入桌面端多 agent 协调,视觉模型开始按需回看原图局部,Sandbox 与本地 agent 也更容易被直接操作。今天更重要的变化在验收端:测试、约束、权限和历史记录决定这些能力能否可靠使用。

今天的 AI 工作界面:上下文、控制面与判断
文章

今天的 AI 工作界面:上下文、控制面与判断

今天的更新覆盖提交前安全扫描、模型路由、托管 agent、Codex 的上下文输入与移动端控制。共同问题很清楚:模型能力进入工作流后,压缩、权限、预览和复核决定它能否稳定使用。

今天的 Agent 信息:能力之外,是运行边界
文章

今天的 Agent 信息:能力之外,是运行边界

今天的信息同时指向 agent 的能力与运行边界:OpenAI 披露评估中的安全事件,检索和记忆方法出现更明确的适用条件,长任务还受上下文压缩、review 带宽和基础设施资源约束。

Agent 开始接手实现,验证和证据成了真正的分水岭
文章

Agent 开始接手实现,验证和证据成了真正的分水岭

安全扫描、真实任务评估和自动测试正在把 agent 的价值从“能不能写代码”推向“能否稳定完成正确的工作”。

2026-07-17:Agent 工作流开始需要可见的界面、记录与容量
文章

2026-07-17:Agent 工作流开始需要可见的界面、记录与容量

Kimi K3 的开放权重与长上下文主张引发大量讨论;更值得留意的是桌面端上下文、浏览器执行回放、运行时密钥、本地转写和硬件容量正在共同决定 Agent 工作流是否真正可用。