过去 50 年,人机交互经历了 CLI 到 GUI 再到 Web 的演进。Shopify CEO Tobi Lütke 最近转发了一条动态,让我注意到了一个叫 flipbook.page 的实验性产品。它被描述为”一个完全按需实时生成的无限视觉浏览器”,核心理念是:你看到的每一页都是一张 AI 实时生成的图片,没有 HTML、没有 CSS、没有 JavaScript,一切皆为像素。
什么是 Flipbook
传统浏览器的渲染链路是:用户点击链接,服务器返回 HTML,浏览器解析 DOM 并执行 CSS 和 JS,最终显示页面。Flipbook 的链路完全不同:用户点击图片中的某个位置,AI 理解意图后实时生成一张新图片,作为下一页展示。
具体流程是这样的。你打开 flipbook.page,输入一个想探索的主题,AI 会生成一张精美的信息图,包含文字、图标、图表和插图。所有文字都是图片像素,不是 HTML 文本覆盖层。你点击图中的某个元素(比如图表中的某个数据点),AI 理解你点击的内容,实时生成一张更深入的图。如此往复,没有终点。这更像在探索一张无限展开的知识地图,而不是在浏览一个个独立的网页。
核心技术架构
图像生成与视频过渡的协同
Flipbook 背后有两套 AI 系统在协作。图像生成模型负责根据用户意图实时绘制每一页,自定义视频模型则在页面之间生成平滑过渡动画。用户开启视频流模式后,两个系统合并为连续 1080p 视频流,页面切换不再是跳变,而是平滑的镜头运动。
| 系统 | 职责 | 类比 |
|---|---|---|
| 图像生成模型 | 根据用户意图实时绘制每一页 | 画家 |
| 自定义视频模型 | 在页面之间生成平滑过渡动画 | 导演 |
内容来源
Flipbook 不是一个纯幻觉生成器,内容来自两个渠道。一是代理式网络搜索(agentic web search),实时从互联网获取真实数据。二是图像模型自身的知识库,即模型训练时学到的世界知识。官方自己也承认,事实准确性大致等同于 ChatGPT/Gemini/Claude 的水平,意味着幻觉问题依然存在。
文字渲染
有一个细节值得关注:官方专门解释了文字渲染问题。所有屏幕上的文字都是由图像模型以像素方式渲染的,没有对图片施加任何文本覆盖层。这意味着图中的每一个字、每一行标题、每一个数字标注,都是图像模型画出来的。偶尔会出现文字不够清晰、位置偏移的问题,但这会随着模型迭代而改善。
这个设计选择带来了一个根本性变化:文字在这个系统中不再是可复制的文本节点,而是视觉元素的一部分。这对无障碍访问(accessibility)和搜索引擎优化(SEO)意味着什么,官方目前没有给出答案。
团队背景
Flipbook 的创始团队由三个人组成。Zain Shah 是前 OpenAI 研究员,负责技术核心。Eddie Jiao 曾在 Humane 和 Slack 工作,Drew Carr 来自 Apple,后两人负责产品设计。算力由 Modal 赞助,投资方是 South Park Commons(这家机构还投了 Notion 和 Figma)。
一个前 OpenAI 研究员加两个顶尖产品设计师的组合,解释了为什么这个项目既有技术深度,又有极强的交互直觉。这个团队配置也暗示了一件事:Flipbook 的核心挑战不在模型本身,而在于如何把模型能力包装成用户愿意持续使用的产品形态。
为什么值得关注
界面从建造到生成
过去 30 年,我们默认了一个前提:人机交互的界面是由工程师编写代码构建的。无论是早期的 HTML 页面、Flash 动画,还是现在的 React 组件,本质上都是工程师定义结构、浏览器渲染、用户交互。Flipbook 打破了这个假设:界面不再是建造出来的,而是生成出来的。
这个转变的意义在于,它把界面的生产权从工程师手中转移到了 AI 手中。传统 Web 开发中,界面是静态的、预定义的,用户只能在工程师预设的框架内交互。Flipbook 的界面是动态的、按需生成的,用户的每一次点击都会创造出一个全新的界面。这相当于把渲染引擎从 GPU 换成了大模型。
信息表达维度的扩展
官方有一段话说得直接:一张图片价值千言万语,但我们的屏幕上却大多只是文字和彩色方块。在传统 Web 上,解释一个复杂概念的选择很有限:写文字让读者自己理解,放图片让设计师提前制作,或者做动图和视频,但成本高且不灵活。
Flipbook 的思路是让 AI 自动选择最适合当前语境的信息表达形式。如果最有效的表达方式是一个词,你会看到一个词;如果是一幅插图,你会看到一幅插图;如果是一个数据可视化,你会看到一个数据可视化。这不是在展示信息,而是在选择最佳的信息传达方式。对于知识密集型的内容消费场景,这种自适应表达能力有实际价值。
HyperCard 的回归
Flipbook 被描述为 AI 完全实现的 HyperCard。HyperCard 是 Apple 在 1987 年推出的软件,允许用户以卡片式方式组织知识和导航,核心理念是知识应该以空间方式探索,而不是线性搜索。这个理念在当时太超前了,最终被万维网取代。37 年后,AI 让空间化知识探索重新有了可能,而且这次不再需要用户手动制作卡片。
不过,HyperCard 当年的失败并非纯粹因为技术不成熟,更多是因为生态和商业模式没有跟上。Flipbook 这次能否避免同样的命运,取决于它能否建立起可持续的内容生态。
演进方向与可行性分析
Flipbook 目前是一个实验,但它规划的演进方向值得逐一分析。
交易闭环
官方举例说,现在你用 Flipbook 研究旅行计划,但预订要去别的地方,未来整个过程都可以在 Flipbook 内完成。从信息探索到行动执行的闭环,听起来很美,但落地难度极高。交易涉及支付、退款、争议处理、商家对接等一系列复杂流程,不是生成一张带按钮的图片就能解决的。短期内更可能的路径是 Flipbook 生成信息图后通过深链接跳转到专业交易平台完成交易,而不是自己建立完整的交易基础设施。
实时数据流
当前页面是快照式图片,但官方规划将股票价格、汇率、天气等数据实时渲染在图中,让 Flipbook 从信息探索工具变成实时动态仪表盘。这个方向技术上可行,但本质上是在图片上叠加实时数据流,每帧都要重新生成,算力成本会是当前的数倍。更现实的方案可能是混合渲染:静态内容由图像模型生成,动态数据以传统 overlay 方式叠加。
交互能力
官方提到未来会支持表单输入、状态存储和复杂操作,让用户直接在生成的图片上打字、选择、拖拽,Flipbook 拥有自己的记忆(购物车、收藏夹、项目草稿)。这意味着交互能力将内嵌到像素生成的过程中,不再是 HTML 元素的专利。但这需要解决一个根本问题:纯图片界面的交互精度和效率远不如 DOM 元素。点击图片上的一个按钮和点击一个真正的 HTML 按钮,前者需要视觉识别来确定点击坐标,后者直接有明确的事件目标。
跨 App 统一入口
这是最大胆的方向。官方想象一个世界,你使用的所有工具都像现实世界一样丰富和可视化。翻译成大白话,Flipbook 可能成为所有 App 的元界面:叫车、发邮件、点外卖,都通过自然语言加视觉界面调度,不需要打开任何独立 App。
| 场景 | 现在 | Flipbook 设想 |
|---|---|---|
| 打车 | 打开 Uber → 输入地址 → 确认 | 说”叫车去机场” → 生成选择图 → 点击确认 |
| 发邮件 | 打开 Gmail → 写邮件 → 发送 | 说”给 Alice 发项目更新” → 生成预览图 → 点击发送 |
| 点外卖 | 打开外卖 App → 选餐厅 → 下单 | 说”点份泰餐” → 生成推荐图 → 点击下单 |
这个愿景的问题在于,每个垂直 App 背后都有大量的业务逻辑、数据和服务对接,不是一个视觉层能替代的。Flipbook 更可能成为这些 App 之上的调度层,而不是替代品。类似操作系统的角色,但底层服务仍然依赖专业 App 提供。
个性化生成
当前生成的是通用信息图,未来结合个人数据后,可以为每个用户生成完全定制的内容:你的健康数据加运动目标生成专属于你的健身计划图,你的消费习惯加预算生成量身定制的理财建议图。这个方向有明确的商业价值,但前提是用户愿意将个人数据交给 Flipbook,这涉及隐私信任问题。
技术挑战
Flipbook 要走的路还很长,当前的核心瓶颈有几个。
算力成本是最直接的问题。每页都由 AI 实时生成,这意味着每次用户点击都要消耗一次完整的图像生成推理成本。模型压缩、缓存热点页面、边缘计算是可能的缓解方向,但在模型推理成本出现数量级下降之前,大规模商业化会面临很大的经济压力。
文字渲染精度方面,官方承认偶尔不完美。图像模型生成文字的能力在快速进步,但要做到传统排版引擎的精度还有差距,尤其是在多语言和复杂排版场景下。
事实准确性等同于 ChatGPT/Gemini/Claude 的水平,意味着幻觉问题没有根本解决。在信息探索场景中,幻觉的容忍度相对高一些(用户会交叉验证),但如果 Flipbook 进入交易或决策场景,准确性要求会大幅提升。
交互延迟也是硬约束。当前生成需要等待时间,虽然流式生成和意图预判可以缓解,但与点击链接即时加载页面的传统 Web 体验相比,延迟差距仍然明显。
| 挑战 | 当前状态 | 突破方向 |
|---|---|---|
| 算力成本 | 每页实时 AI 生成,极其昂贵 | 模型压缩、缓存热点页面、边缘计算 |
| 文字渲染精度 | 官方承认偶尔不完美 | 下一代图像模型的文本能力 |
| 事实准确性 | 类似 ChatGPT 水平,可能有幻觉 | RAG + 实时搜索 + 引用溯源 |
| 交互延迟 | 生成需要等待时间 | 流式生成、预判意图提前生成 |
| 商业化模式 | 目前靠赞助算力 | 订阅制、按页面消耗计费、B2B |
个人判断
第一次看到 Flipbook 的演示时,我的反应是怀疑它的实用性。但仔细想过之后,它触及了一个本质问题:我们为什么需要浏览器?浏览器的核心功能是获取信息并交互,传统 Web 用 HTML/CSS/JS 实现了这个功能,但这只是一种实现方式,不是唯一的方式。
Flipbook 用 AI 重新定义了这个界面形态:不再是工程师预先写好的页面,而是根据用户意图即时生成的视觉表达。从预先录制的电视节目到实时互动的直播,内容不再是固定的,而是随需求变化的。
这个方向是有价值的,但我对它短期内替代传统 Web 持保留态度。纯图片界面在信息密度、交互精度、无障碍访问、搜索索引等方面都劣于 DOM 界面。Flipbook 更可能成为一个补充性的信息探索工具,而不是 Web 的替代品。它最适合的场景是开放式的知识探索和学习,而不是需要精确操作和高效率的任务型场景。
界面从被构建走向被生成,这个趋势是真实的。但生成式界面和结构化界面会长期共存,各有适用场景。Flipbook 的价值在于它率先证明了生成式界面的可行性,为这个方向提供了一个具体的产品参考。