当 AI 演示开始自己构建、操作和验收结果

今天的几个样本都在尝试把 AI 放进一条更完整的执行链:它要做出东西,也要操作、验证,并把结果交给人。

Summary

Devin 在 macOS 中构建并测试 iOS 游戏,Claude 长时运行后交付可试玩作品,还有人给 AI 生成的 3D 游戏补上了编辑器。它们都把 AI 的能力展示成可观察、可操作的过程,真实成熟度仍有待验证。

快速概览

  • Devin 的演示把原生 iOS 开发、模拟器操作、试玩和测试报告放在同一条链路里。
  • 一次 24 小时的 Claude 运行交付了一款可试玩游戏,适合观察长流程的一致性能否成立。
  • 3D 游戏编辑器把文字生成后的空间调整交回给人直接操作。

这些内容共同指向一个更具体的变化:AI 的演示开始需要给出过程和交付物,只有一句“做到了”已经不够。

今天有趣的信息

1. Devin 在 macOS 中构建、试玩并测试 iOS 游戏

  • 发生了什么:Devin Cloud Agents 现在能在带 Xcode、iOS Simulator 与签名设置的 macOS 环境中运行。演示里,agent 生成原生 iOS 游戏,接着自己操作模拟器试玩和测试,最后把游戏录屏与测试报告交给人审阅。
  • 为什么值得关注:这条链路覆盖了代码生成之后更麻烦的部分:真实工具操作、可见验证和交接材料。它让人能直接检查 agent 做了什么。
  • 我应该关注什么点:签名凭据如何隔离、失败如何恢复、测试覆盖是否足够,仍需要真实项目里的证据。
  • 相关帖子:Devin 在 macOS 中构建并测试 iOS 游戏(dabit3)
  • 你的判断:这是今天最完整的样本。computer use 的意义在于把测试过程和证据一起交给人,而不是停在代码已经生成。

2. 让 Claude 连续运行 24 小时,最后得到一款游戏

  • 发生了什么:这条帖子发布于 7 月 27 日,今天被重新发现。作者称让 Claude Opus 5 连续运行 24 小时,最终得到一款完整游戏;没有外部素材或既有代码,像素和音效也由 Claude 生成。作者同时提供了提示词、工作流、代码和试玩链接。
  • 为什么值得关注:游戏会同时暴露代码、素材、交互和状态的一致性问题。它比一个短页面更能检验长时运行能否收敛到可用成品。
  • 我应该关注什么点:人工介入程度、调用成本、bug 密度和复现过程还需要独立核对。现在能确认的是成品被展示出来,制作细节仍主要来自作者表述。
  • 相关帖子:Claude 连续运行 24 小时生成游戏(anshuc)
  • 你的判断:这是一条值得实际试玩的实验样本。重点不在“模型做了游戏”,而在长时间让模型自己工作时,哪些环节还能保持一致。

3. 给 AI 生成的 3D 游戏配上可视化编辑器

  • 发生了什么:作者用 Codex 制作 WebGL / Three.js 小游戏时,发现只靠文字描述很难调整 3D 空间布局,于是让 Codex 同步做出类似 Blender 的编辑器。这个编辑器可选择资产,调整位置、缩放和旋转;展示关卡属于仍在制作中的《爱丽丝》系列第二章。
  • 为什么值得关注:生成一个 3D 场景只是第一步,后续构图和空间调节仍需要直接操作。这个样本把编辑器放进生成流程里。
  • 我应该关注什么点:状态保存、版本管理、场景逻辑和多人协作能力仍未知。
  • 相关帖子:Codex 为 3D 游戏同步生成编辑器(ring_hyacinth)
  • 你的判断:AI 能快速做出场景,也需要让人能可靠地改动场景。这是个很具体的制作问题。

关于这个日报

这份内容基于 X 上的公开搜索结果,筛选那些能直接展示 AI 实际效果、交互方式或工作流的早期样本。这里保留演示中的不确定性,也不把单个 demo 当成行业结论。