AI 实验把生成能力接到界面和现场任务|2026-08-07

今天的样本把 AI 接到可操作的界面和具体的现场任务,重点从“生成了什么”转向“人如何继续修改、agent 如何进入真实软件”。

快速概览

  • PropMotion 让 Claude Code 在 SwiftUI 中生成带物理、灯光和触觉反馈的 3D 动画。
  • /human-review 把 HTML / Markdown 的直接编辑、图片调整和给 AI 留评论放进一个本地界面。
  • Cua Driver 尝试让 agent 在同一会话里操作 Chromium 标签页和原生桌面应用。
  • 一个传送带土豆计数系统只用单帧标注训练 YOLO11 nano,提供了低数据视觉系统的实用样本。
  • 另有一个每次刷新都会变化的 AI 生成网站,信息有趣,当前实现细节较少。

今天有趣的信息

1. Claude Code 开始参与 SwiftUI 里的 3D 动画实现

  • 发生了什么:dembsky 发布 PropMotion,一个让 Claude Code 构建和动画化 SwiftUI 3D 场景的 skill。它提供透明 3D 舞台、入场和弹跳等动作、手写物理、实时阴影、灯光与触觉反馈,几何体由代码生成,不依赖 Blender 或外部资产,还能把多个场景串成连续片段。作者说这套方法来自 Gymscle 健身追踪应用的 3D 动画实践。
  • 为什么值得关注:AI 参与的是原生应用的实现层,结果包含物理、光照、触觉和连续场景,已经超出静态视觉稿。
  • 我应该关注什么点:实际 skill 的稳定性、生成代码的可维护性、平台支持,以及复杂动画的返工成本。
  • 相关帖子:PropMotion 用 Claude Code 生成 SwiftUI 3D 动画(dembsky)
  • 你的判断:这是今天最完整的创作工具样本之一,值得观察它能否变成可复用的原生动画工作流。

2. /human-review 把人工修改放进内容界面

  • 发生了什么:petergyang 开源 /human-review skill,为 HTML 和 Markdown 文件提供可视化编辑器。用户可以直接编辑格式、调整图片尺寸,并像使用 Google Docs 一样在页面上给 AI 留评论;作者称 PRD、落地页和产品文案都在使用这套流程,整个审阅过程在本地运行。
  • 为什么值得关注:人可以直接指向页面里的内容给出修改意见,agent 不需要依赖“请修改第三段”这类位置描述。
  • 我应该关注什么点:评论如何回写源文件,是否保留 diff 和审计记录,复杂 Markdown、图片与 HTML 结构能否稳定处理。
  • 相关帖子:/human-review 用可视化界面给 AI 留修改意见(petergyang)
  • 你的判断:这条的实用性高于展示性。人和 agent 的协作入口开始进入内容本身,值得继续观察。

3. Cua Driver 连接浏览器和桌面应用

  • 发生了什么:trycua 宣布把 browser use 加入 Cua Driver,主张提供一个无需浏览器扩展的 browser-use 接口,并将它放进统一的 computer-use driver。帖子强调 agent 可以在同一会话中使用精确的 Chromium 标签页和原生桌面应用。
  • 为什么值得关注:它针对网页和本地软件之间的切换问题,接口形态更接近真实工作环境。
  • 我应该关注什么点:权限模型、窗口和标签页状态、异常恢复、跨应用数据传递,以及人工接管方式。
  • 相关帖子:Cua Driver 加入无扩展浏览器操作接口(trycua)
  • 你的判断:接口方向清楚,实际价值取决于跨应用状态能否稳定处理。

4. 一帧标注训练的传送带土豆计数系统

  • 发生了什么:帖子介绍 Viet 的一个小型视觉系统,用 Ultralytics ObjectCounter 和 YOLO11 nano 在传送带视频中数土豆。由于没有现成数据集,作者用 SAM 2 给单帧画框,再训练模型;帖子称它可以在整段视频中工作,并附有演示视频和项目入口。
  • 为什么值得关注:这是低数据、低算力、明确任务的真实世界视觉实验,展示了 AI 系统围绕一个具体工位问题成立的路径。
  • 我应该关注什么点:光照、遮挡、传送带速度、土豆品种变化,以及计数结果如何接入生产系统。
  • 相关帖子:单帧训练传送带土豆计数系统(IlirAliu_ 转述)
  • 你的判断:实用信号很明确,当前证据来自转述帖,泛化能力还不能确认。

5. 每次刷新都变化的 AI 生成网站

  • 发生了什么:ky__zo 称这个网站完全用 GPT Image 2 和 Seedance 2.0 制作,每次刷新都会变化,并附有视频和体验链接。原帖没有说明变化发生在视觉素材、页面结构还是运行时逻辑层。
  • 为什么值得关注:它把生成模型用于持续变化的网页表面,提供了一个“每次进入都不同”的交互方向。
  • 我应该关注什么点:变化是否由真实运行时生成,页面状态能否保存,生成成本和加载速度如何,用户是否能影响下一次结果。
  • 相关帖子:每次刷新都变化的 AI 生成网站(ky__zo 转述 peardotno)
  • 你的判断:有趣但证据较弱,适合作为视觉实验信号,暂时不能据此判断它具备稳定的生成式 UI 能力。

关于这个日报

这份内容来自每天对 X 上 AI 实验、demo 和原型的筛选,优先记录能直接看到效果、也能看出能力边界的样本。文中的速度、质量与能力描述以原帖为准,未经独立测试。