AI 终于解决了幻灯片设计,最后一公里是可编辑性

Read in English

过去很多所谓的“AI 做 PPT”,本质上只是更快地排一个标题、几条项目符号,再配一张图库图片。它能用,但很难让人觉得这页真的经过设计。图像生成模型改变了这件事:它们已经可以在一张画布里完成复杂系统图、漫画式讲解、产品发布页、课程插画和非常规的信息排版。

从视觉结果看,幻灯片设计似乎终于接近被解决了。但最有表现力的方案往往只给你一张图片。标题是像素,图表标签是像素,卡片不能移动,数字也不能修改。设计完成了,PowerPoint 的工作却还没有开始。

我们的判断是:更合理的 AI 幻灯片工作流,正在变成“先生成图片,再重建为可编辑 PowerPoint”。让图像模型负责不受限制的视觉创作,再让另一套系统把结果还原成真正可以修改和交付的对象。

行业里生成幻灯片的三条路线

目前常见的 AI 幻灯片产品,大体走三条路线。它们都能解决一部分问题,但优化目标并不相同。

方式擅长什么根本限制
直接生成 PPTX文件从一开始就是原生对象,天然可编辑。模型必须把视觉意图翻译成坐标、形状、字体和大量排版指令。复杂插画、密集构图和自由视觉语言很难用标准 PowerPoint 图形稳定表达。
基于 HTML 生成结构稳定、生成速度快,适合规则化和重复性页面。容易收敛到卡片、分栏和文本块。复杂示意图、漫画、自由排版和特殊视觉构图不容易表达,导出到 PowerPoint 时也可能损失布局。
直接生成幻灯片图片视觉自由度最高。字体、插画、地图、图表、质感和氛围可以在一张画布里统一完成。输出通常是一张扁平位图,看起来像幻灯片,却不能像幻灯片一样编辑。

当可编辑性和规则结构比视觉表达更重要时,直接生成 PPTX 是正确选择;当页面主要是规则化内容时,HTML 也非常高效。但如果需求是一张内容密集的解释图、一页漫画式叙事,或者一种根本不适合套模板的视觉语言,图片生成拥有明显优势:它不受 PowerPoint 形状词汇和浏览器排版系统的限制。

缺失的另一半:把图片重建成对象

如果图片生成是更好的视觉前端,下一步自然就是恢复可编辑性。市面上最常见的答案是 OCR:识别文字,再把文本框盖到图片上。这能让部分文字输入,但并没有把图片还原成真正的幻灯片。

一张真实的 PPT 是有层次的文档。文字属于卡片或图表,形状有填充、边框和叠放顺序,箭头连接不同区域。把原图里的文字拿走后,后面的颜色、纹理和边框还必须补回来。最后还要面对 PowerPoint 自己的字体度量、换行、最小尺寸和渲染规则。

因此,真正可用的重建必须同时解决:

这也是为什么“文字能改”远远不够。单纯的 OCR 盖字在演示里看起来很漂亮,但用户一移动元素,下面的旧文字还在,卡片也不是卡片,所谓结构仍然困在一张背景图里。

Image2PPT 重建什么,又刻意保留什么

Image2PPT 不是让一个模型一次性重画整页,而是通过多阶段系统完成结构理解、文字与规整几何重建、复杂视觉元素拆分、背景修复和原生 PPTX 渲染。

产品上最重要的取舍,是不强迫每一个像素都变成矢量图形。文字和简单结构应该可编辑,因为用户经常要修改它们;地图、复杂图表、插画和图标如果重画会明显变差,就应该原样保留为独立图片。它们内部的像素不能逐点修改,但可以单独移动、裁剪、替换、缩放或删除。

这是一种更诚实的“可编辑”:不是承诺每一个像素都变成原生图形,而是把整页从一张锁死的截图,恢复成真正有用的一组对象。

用一张故意做难的图验证

为了验证这套思路,我们生成了一张内容密集的城市水务数字孪生幻灯片。它同时包含中央城市插画、地图、曲线图、公式、卡片、图标、图例和长距离连接线。这接近重建任务的困难输入,而不是一张专门挑出来展示成功率的标题页。

转换前的 AI 生成城市水务数字孪生幻灯片原图
原始 16:9 幻灯片图片。视觉内容完整,但所有标题、标签、卡片和连接线都只是像素。

转换完成后,我们用 Microsoft PowerPoint 打开文件并执行“全选”。下面这张图故意显得很乱:每一个选框都在证明那里是一个独立的 PowerPoint 对象。

Microsoft PowerPoint 全选转换后的 165 个独立对象
在 Microsoft PowerPoint 中全选重建结果。点击图片可以查看原始尺寸和完整选框。
78个可编辑文字框
33个 PowerPoint 原生形状
54个独立图片对象

78 个文字框可以直接重新输入;33 个形状可以移动、缩放和修改样式;54 个图片对象负责保留地图、图表、示意图和插画等复杂视觉区域,可以独立移动、裁剪、替换或删除。

结果并不完美。少数连接线附近仍有清理残迹,一些密集公式文字比原图更拥挤。我们把这些问题明确写出来,也正因为如此才展示真实的 PowerPoint 全选图,而不是声称“像素级完美转换”。但这页已经不再是一张无法操作的图片,而是一份可以进入修改、审核和交付流程的工作文件。

这会怎样改变 AI 做 PPT 的工作流

过去大家默认,一个 AI 幻灯片系统必须直接输出 PowerPoint。这个要求把视觉创作和文档结构挤在同一个生成步骤里。两阶段流程可以把它们分开:

  1. 先用图像模型探索视觉方向,生成效果最好的幻灯片图片。
  2. 再通过重建恢复文字、布局和独立视觉对象。
  3. 最后回到 PowerPoint 修改文案、替换数字、移动元素、加入 Logo 并交付。

这并不意味着直接生成 PPTX 或 HTML 会消失。规则化汇报、固定模板和数据驱动页面仍然更适合这些方式。我们想表达的判断更具体:图片生成消除了视觉上限,而对象级重建消除了“只能看、不能改”的代价。两者组合之后,才能完成任何单一路线都很难独立完成的幻灯片。

最后一公里本身就是产品

生成一张漂亮图片很惊艳,但把它交给同事,让对方下周一还能改标题、换数字、挪卡片,才是真正有用。视觉结果和可编辑工作文件之间的距离,就是剩下的工程问题。

Image2PPT 的目标,是把这后半段做得可靠:不假装每个像素都能完美变成原生对象,而是把用户真正需要修改的文字和结构恢复出来,同时忠实保留不适合重画的复杂视觉。AI 也许已经解决了幻灯片应该长什么样;接下来的问题,是怎样把这张幻灯片真正交还给用户。

把 AI 生成的幻灯片图片变成可编辑 PPT

先上传一张最有代表性的困难页面,在 PowerPoint 里打开并全选,看看恢复出来的对象能否省掉手工重做。