今天看到的几个 AI 实验:多模态工作台、本地浏览器和会做简报的 agent

今天的四个样本把 AI 接到了更具体的工作面:多模态能力可以跨 agent harness 复用,Chrome 端侧 AI 能处理图片和音频,演示文稿 agent 用真实简报跑完整流程,Three.js 页面则把 3D 生成变成可继续调整的参数。

快速概览

  • Qwen-MM-Plugins 把 skill、可选 MCP server 和共享配置组合起来,让一组多模态能力可以服务多个 agent harness。
  • web-ai-sdk 在 Chrome 端侧 AI 中处理图片和音频,作者称不需要服务器或 API key。
  • AiPPT Agent Mode 用真实业务简报测试从理解任务、组织内容到生成幻灯片的过程,最终仍保留人工修改。
  • MengTo 用 Three.js 做出可构建塔楼的互动页面,把天气、时间、风格和体积约束放进同一个成品。

今天有趣的信息

1. 多模态能力开始变成可以迁移的 agent 工具层

  • 发生了什么:screenest_ai 整理了 Qwen-MM-Plugins 的结构:skill 负责告诉 agent 某项能力存在,可选 MCP server 提供工具,共享配置可以服务 Codex、Claude Code、Qwen Code、Gemini CLI 等 harness。演示包括长视频转关系图、通过对话修正 3D 房间、文档阅读、OCR、Blender / FreeCAD 控制和对话式视频编辑;Qwen 官方帖确认了这套 capability layer 的方向。
  • 为什么值得关注:多模态能力的入口开始独立于某一个 agent harness,迁移和检查的成本有机会下降。
  • 我应该关注什么点:哪些步骤真正本地可用,哪些需要 API key;Windows 与 WSL2 的支持情况;第三方整理和官方演示之间有哪些差异。
  • 相关帖子:Qwen-MM-Plugins 的多模态能力层(screenest_ai)Qwen 官方演示入口(Alibaba_Qwen)
  • 你的判断:这条最值得先点开。它给出了一种“能力作为可安装层” 的产品形态,具体工具仍要逐项验证,尤其要看哪些环节依赖外部服务。

2. Chrome 端侧 AI 处理图片和音频

  • 发生了什么:obetomuniz 展示 web-ai-sdk 的初始多模态支持,把图片和音频交给 Chrome 的端侧 AI,并用类型化接口描述照片和 Mermaid 图。作者强调不需要服务器或 API key。
  • 为什么值得关注:原始素材可以留在设备上,浏览器也能成为轻量的多模态工作台。
  • 我应该关注什么点:设备和 Chrome 版本要求、模型下载时间、响应速度,以及图片和音频的组合能力。
  • 相关帖子:Chrome 端侧 AI 的图片与音频 demo(obetomuniz)
  • 你的判断:这是一个小而具体的实验,适合继续尝试;当前证据还不能说明它已经适用于大多数设备。

3. 用真实业务简报测试演示文稿 agent

  • 发生了什么:viipin8 给 Agent Mode 一份真实业务演示文稿任务,选择 Skills 和 Visual Style,让 agent 先理解简报,再组织内容、搭建结构并生成幻灯片。thread 连续展示执行过程和最终结果,作者认为内容流和视觉质量较稳,演示前仍会做少量修改。
  • 为什么值得关注:它把“生成 PPT”变成了带真实输入、过程可见和人工收尾的工作流测试。
  • 我应该关注什么点:简报复杂度、事实核验、结构判断和视觉修改分别由谁负责;作者带推广信息,结果应按自测理解。
  • 相关帖子:用真实业务简报测试 Agent Mode(viipin8)Agent Mode 组织内容并生成幻灯片(viipin8)最终演示文稿与人工修改边界(viipin8)
  • 你的判断:最值得看的是执行过程,成品质量仍需要用自己的真实简报复测。

4. Three.js 塔楼页面把天气和时间做成参数

  • 发生了什么:MengTo 用 Three.js 做了一个可构建塔楼的互动网站,加入天气和一天中的时间变化,并称整体体积约 1–2 MB。用户可以让 AI 修改不同国家和时代的塔楼风格,以及雪雨、光照等效果;制作中使用 Claude Code 作为 harness,用 Higgsfield 生成纹理和音效。
  • 为什么值得关注:生成结果保留了继续调整的入口,同时接受浏览器体积约束,展示了一个比较完整的个人网页实验。
  • 我应该关注什么点:不同设备上的渲染性能、体积统计口径、AI 修改能否保持设计一致,以及人工修正的比例。
  • 相关帖子:带天气与时间变化的 Three.js 塔楼页面(MengTo)
  • 你的判断:这是最容易直接看懂的成品案例。它更适合拿来研究“生成结果如何继续交互”,暂时不扩大解释作者关于一遍生成的说法。

关于这个日报

这份内容来自公开 X 上对 AI 实验型内容的每日探索,重点寻找能直接看到效果、能反映实际能力边界、又值得继续追踪的 demo、prototype、工具和工作流。由 AI 做初步过滤,再由半庄整理、取舍和补充判断。