AI 开始进入设备、工具和交付流程
这批实验把 agent 放进原生设备、结构化工程工具和交付检查,展示了更具体的使用边界。
快速概览
- phone-harness 让 Claude Code 尝试控制原生 iPhone 应用。
- Kimi Computer Use 通过 MCP 连接多个 agent harness,并展示了跨工具接入的可能。
- Multi-Agent CAD 把文本到 CAD 做成开源多 agent 管线。
- OpenTag 把 generative UI、人工审批和线程上下文放进 Slack 与 Teams。
- 三个可复用 skill 把设计复核、代码整理和端到端测试串成交付前检查。
这批内容的共同点很具体:agent 开始进入设备、工程对象、团队协作和质量门。它们仍然属于早期信号,帖子里的兼容性、成本和可靠性主张都需要继续验证。
今天有趣的信息
1. phone-harness 让 Claude Code 控制原生 iPhone 应用
- 发生了什么:
shawn_pana发布 phone-harness,帖子宣称 Claude Code 可以像人一样操作任意 iOS 应用。它主打原生 iPhone 控制,不需要 API 或越狱;连接一次后可以持续控制,并用一个 prompt 完成设置,帖子附有演示视频。 - 为什么值得关注:computer use 从浏览器和桌面进入了原生手机应用,agent 能接触到更完整的个人设备工作流。
- 我应该关注什么点:权限如何授予和撤销、后台操作的稳定性、不同应用的兼容范围,以及敏感界面是否有人工确认。
- 相关帖子:phone-harness 让 Claude Code 控制 iPhone(shawn_pana)
- 你的判断:这是今天最值得先验证的样本。入口清楚、效果可见,真正的价值取决于它能否把一次演示变成可靠的手机操作层。
2. Kimi Computer Use 通过 MCP 接入多个 agent harness
- 发生了什么:
LinearUncle称自己实测 Kimi Computer Use 走 MCP,可以对接任意 harness;他还写到用没有视觉能力的 DeepSeek v4 Flash 跑通了任务。安装方式是在 Kimi Code 中执行/plugin,随后可以把 Kimi CU 安装给 Claude Code 和 Codex,帖子附有截图和引用帖。 - 为什么值得关注:这条样本把问题放到接入层:computer use 是否只能绑定某个官方应用,还是可以作为插件复用。
- 我应该关注什么点:所谓“任意 harness”的实际范围、插件权限、无视觉模型能完成的任务类型,以及不同 harness 的状态传递。
- 相关帖子:Kimi Computer Use 的 MCP 与跨 harness 实测(LinearUncle)
- 你的判断:有操作过程的自述比口号更有价值,证据仍不足以证明广泛兼容,适合作为开放接入方向的早期信号。
3. Multi-Agent CAD 把文本到 CAD 做成低成本多 agent 管线
- 发生了什么:
xyz2maureen发布开源 Multi-Agent CAD,目标是从文本生成 3D 资产。帖子声称每个资产成本约 0.15 美元,约为 CAD Skills 的 1/13,并具备更快推理和更高准确率;项目源于机器人学习项目,作者把 CAD 专长和 agent workflow 设计组合进多 agent 管线。 - 为什么值得关注:agent 的工作对象是有结构约束的工程资产,流程里包含专业知识和多步协作,和一次性生成一张 3D 图的验证方式不同。
- 我应该关注什么点:生成资产能否继续编辑、部件连接是否可靠、成本计算口径,以及视频中的准确率主张能否复现。
- 相关帖子:Multi-Agent CAD 的文本到 CAD 管线(xyz2maureen)
- 你的判断:它补充了 agent 进入 CAD 的另一种路径:重点放在多 agent 生产管线和成本约束。开源代码的真实完成度值得继续看。
4. OpenTag 把 generative UI、审批和线程上下文放进 Slack 与 Teams
- 发生了什么:
ataiiam发布 OpenTag,一个可直接运行的开源 LangChain agent,接入 Slack 和 Teams 的 Channels SDK。帖子列出 generative UI、流式回复、Human in the Loop 审批和完整 thread context,并提供 GitHub 入口和演示视频。 - 为什么值得关注:动态界面和审批、上下文、团队聊天放在同一个执行流程里,agent 的结果开始贴近协作现场。
- 我应该关注什么点:审批前后状态是否清晰、agent 生成的界面是否可复用、线程上下文如何避免污染,以及失败任务如何回退。
- 相关帖子:OpenTag 在 Slack 与 Teams 中运行带审批的 agent(ataiiam)
- 你的判断:这是今天最完整的协作工作流样本之一。值得看的重点是界面、审批和上下文如何共同工作。
5. 三个 skill 把设计复核、代码整理和端到端测试串成质量门
- 发生了什么:
BHolmesDev分享自己每次 prompt 都使用的三个 skill:/taste-review让 Codex 就设计问题询问 Claude,/simplify让 agent 用普通英语重构代码,/test-app在返回结果前做端到端应用验证。帖子附有 skill 说明和演示视频。 - 为什么值得关注:它把 agent 交付过程拆成设计判断、代码整理和真实应用验证三个可复用步骤,展示了个人开发者如何给 agent 加质量检查。
- 我应该关注什么点:这些检查是否真的能阻止回归、设计评审如何形成可执行结论、测试 skill 能覆盖多少真实环境。
- 相关帖子:用三个 skill 检查 agent 产出的应用(BHolmesDev)
- 你的判断:这是一个小而实用的流程样本。价值在于把交付前验证写成固定动作。
关于这个日报
这份内容记录 X 上值得继续观察的 AI 实验,由 半庄 整理、取舍和补充判断。它更关心别人用 AI 做出了什么具体东西,以及这些东西把交互、工具和运行环境带到了哪里。

