0%

Flipbook 深度解析:当浏览器不再需要 HTML

过去 50 年,人机交互经历了 CLI 到 GUI 再到 Web 的演进。Shopify CEO Tobi Lütke 最近转发了一条动态,让我注意到了一个叫 flipbook.page 的实验性产品。它被描述为”一个完全按需实时生成的无限视觉浏览器”,核心理念是:你看到的每一页都是一张 AI 实时生成的图片,没有 HTML、没有 CSS、没有 JavaScript,一切皆为像素。

什么是 Flipbook

传统浏览器的渲染链路是:用户点击链接,服务器返回 HTML,浏览器解析 DOM 并执行 CSS 和 JS,最终显示页面。Flipbook 的链路完全不同:用户点击图片中的某个位置,AI 理解意图后实时生成一张新图片,作为下一页展示。

具体流程是这样的。你打开 flipbook.page,输入一个想探索的主题,AI 会生成一张精美的信息图,包含文字、图标、图表和插图。所有文字都是图片像素,不是 HTML 文本覆盖层。你点击图中的某个元素(比如图表中的某个数据点),AI 理解你点击的内容,实时生成一张更深入的图。如此往复,没有终点。这更像在探索一张无限展开的知识地图,而不是在浏览一个个独立的网页。


核心技术架构

图像生成与视频过渡的协同

Flipbook 背后有两套 AI 系统在协作。图像生成模型负责根据用户意图实时绘制每一页,自定义视频模型则在页面之间生成平滑过渡动画。用户开启视频流模式后,两个系统合并为连续 1080p 视频流,页面切换不再是跳变,而是平滑的镜头运动。

系统 职责 类比
图像生成模型 根据用户意图实时绘制每一页 画家
自定义视频模型 在页面之间生成平滑过渡动画 导演

内容来源

Flipbook 不是一个纯幻觉生成器,内容来自两个渠道。一是代理式网络搜索(agentic web search),实时从互联网获取真实数据。二是图像模型自身的知识库,即模型训练时学到的世界知识。官方自己也承认,事实准确性大致等同于 ChatGPT/Gemini/Claude 的水平,意味着幻觉问题依然存在。

文字渲染

有一个细节值得关注:官方专门解释了文字渲染问题。所有屏幕上的文字都是由图像模型以像素方式渲染的,没有对图片施加任何文本覆盖层。这意味着图中的每一个字、每一行标题、每一个数字标注,都是图像模型画出来的。偶尔会出现文字不够清晰、位置偏移的问题,但这会随着模型迭代而改善。

这个设计选择带来了一个根本性变化:文字在这个系统中不再是可复制的文本节点,而是视觉元素的一部分。这对无障碍访问(accessibility)和搜索引擎优化(SEO)意味着什么,官方目前没有给出答案。


团队背景

Flipbook 的创始团队由三个人组成。Zain Shah 是前 OpenAI 研究员,负责技术核心。Eddie Jiao 曾在 Humane 和 Slack 工作,Drew Carr 来自 Apple,后两人负责产品设计。算力由 Modal 赞助,投资方是 South Park Commons(这家机构还投了 Notion 和 Figma)。

一个前 OpenAI 研究员加两个顶尖产品设计师的组合,解释了为什么这个项目既有技术深度,又有极强的交互直觉。这个团队配置也暗示了一件事:Flipbook 的核心挑战不在模型本身,而在于如何把模型能力包装成用户愿意持续使用的产品形态。


为什么值得关注

界面从建造到生成

过去 30 年,我们默认了一个前提:人机交互的界面是由工程师编写代码构建的。无论是早期的 HTML 页面、Flash 动画,还是现在的 React 组件,本质上都是工程师定义结构、浏览器渲染、用户交互。Flipbook 打破了这个假设:界面不再是建造出来的,而是生成出来的。

这个转变的意义在于,它把界面的生产权从工程师手中转移到了 AI 手中。传统 Web 开发中,界面是静态的、预定义的,用户只能在工程师预设的框架内交互。Flipbook 的界面是动态的、按需生成的,用户的每一次点击都会创造出一个全新的界面。这相当于把渲染引擎从 GPU 换成了大模型。

信息表达维度的扩展

官方有一段话说得直接:一张图片价值千言万语,但我们的屏幕上却大多只是文字和彩色方块。在传统 Web 上,解释一个复杂概念的选择很有限:写文字让读者自己理解,放图片让设计师提前制作,或者做动图和视频,但成本高且不灵活。

Flipbook 的思路是让 AI 自动选择最适合当前语境的信息表达形式。如果最有效的表达方式是一个词,你会看到一个词;如果是一幅插图,你会看到一幅插图;如果是一个数据可视化,你会看到一个数据可视化。这不是在展示信息,而是在选择最佳的信息传达方式。对于知识密集型的内容消费场景,这种自适应表达能力有实际价值。

HyperCard 的回归

Flipbook 被描述为 AI 完全实现的 HyperCard。HyperCard 是 Apple 在 1987 年推出的软件,允许用户以卡片式方式组织知识和导航,核心理念是知识应该以空间方式探索,而不是线性搜索。这个理念在当时太超前了,最终被万维网取代。37 年后,AI 让空间化知识探索重新有了可能,而且这次不再需要用户手动制作卡片。

不过,HyperCard 当年的失败并非纯粹因为技术不成熟,更多是因为生态和商业模式没有跟上。Flipbook 这次能否避免同样的命运,取决于它能否建立起可持续的内容生态。


演进方向与可行性分析

Flipbook 目前是一个实验,但它规划的演进方向值得逐一分析。

交易闭环

官方举例说,现在你用 Flipbook 研究旅行计划,但预订要去别的地方,未来整个过程都可以在 Flipbook 内完成。从信息探索到行动执行的闭环,听起来很美,但落地难度极高。交易涉及支付、退款、争议处理、商家对接等一系列复杂流程,不是生成一张带按钮的图片就能解决的。短期内更可能的路径是 Flipbook 生成信息图后通过深链接跳转到专业交易平台完成交易,而不是自己建立完整的交易基础设施。

实时数据流

当前页面是快照式图片,但官方规划将股票价格、汇率、天气等数据实时渲染在图中,让 Flipbook 从信息探索工具变成实时动态仪表盘。这个方向技术上可行,但本质上是在图片上叠加实时数据流,每帧都要重新生成,算力成本会是当前的数倍。更现实的方案可能是混合渲染:静态内容由图像模型生成,动态数据以传统 overlay 方式叠加。

交互能力

官方提到未来会支持表单输入、状态存储和复杂操作,让用户直接在生成的图片上打字、选择、拖拽,Flipbook 拥有自己的记忆(购物车、收藏夹、项目草稿)。这意味着交互能力将内嵌到像素生成的过程中,不再是 HTML 元素的专利。但这需要解决一个根本问题:纯图片界面的交互精度和效率远不如 DOM 元素。点击图片上的一个按钮和点击一个真正的 HTML 按钮,前者需要视觉识别来确定点击坐标,后者直接有明确的事件目标。

跨 App 统一入口

这是最大胆的方向。官方想象一个世界,你使用的所有工具都像现实世界一样丰富和可视化。翻译成大白话,Flipbook 可能成为所有 App 的元界面:叫车、发邮件、点外卖,都通过自然语言加视觉界面调度,不需要打开任何独立 App。

场景 现在 Flipbook 设想
打车 打开 Uber → 输入地址 → 确认 说”叫车去机场” → 生成选择图 → 点击确认
发邮件 打开 Gmail → 写邮件 → 发送 说”给 Alice 发项目更新” → 生成预览图 → 点击发送
点外卖 打开外卖 App → 选餐厅 → 下单 说”点份泰餐” → 生成推荐图 → 点击下单

这个愿景的问题在于,每个垂直 App 背后都有大量的业务逻辑、数据和服务对接,不是一个视觉层能替代的。Flipbook 更可能成为这些 App 之上的调度层,而不是替代品。类似操作系统的角色,但底层服务仍然依赖专业 App 提供。

个性化生成

当前生成的是通用信息图,未来结合个人数据后,可以为每个用户生成完全定制的内容:你的健康数据加运动目标生成专属于你的健身计划图,你的消费习惯加预算生成量身定制的理财建议图。这个方向有明确的商业价值,但前提是用户愿意将个人数据交给 Flipbook,这涉及隐私信任问题。


技术挑战

Flipbook 要走的路还很长,当前的核心瓶颈有几个。

算力成本是最直接的问题。每页都由 AI 实时生成,这意味着每次用户点击都要消耗一次完整的图像生成推理成本。模型压缩、缓存热点页面、边缘计算是可能的缓解方向,但在模型推理成本出现数量级下降之前,大规模商业化会面临很大的经济压力。

文字渲染精度方面,官方承认偶尔不完美。图像模型生成文字的能力在快速进步,但要做到传统排版引擎的精度还有差距,尤其是在多语言和复杂排版场景下。

事实准确性等同于 ChatGPT/Gemini/Claude 的水平,意味着幻觉问题没有根本解决。在信息探索场景中,幻觉的容忍度相对高一些(用户会交叉验证),但如果 Flipbook 进入交易或决策场景,准确性要求会大幅提升。

交互延迟也是硬约束。当前生成需要等待时间,虽然流式生成和意图预判可以缓解,但与点击链接即时加载页面的传统 Web 体验相比,延迟差距仍然明显。

挑战 当前状态 突破方向
算力成本 每页实时 AI 生成,极其昂贵 模型压缩、缓存热点页面、边缘计算
文字渲染精度 官方承认偶尔不完美 下一代图像模型的文本能力
事实准确性 类似 ChatGPT 水平,可能有幻觉 RAG + 实时搜索 + 引用溯源
交互延迟 生成需要等待时间 流式生成、预判意图提前生成
商业化模式 目前靠赞助算力 订阅制、按页面消耗计费、B2B

个人判断

第一次看到 Flipbook 的演示时,我的反应是怀疑它的实用性。但仔细想过之后,它触及了一个本质问题:我们为什么需要浏览器?浏览器的核心功能是获取信息并交互,传统 Web 用 HTML/CSS/JS 实现了这个功能,但这只是一种实现方式,不是唯一的方式。

Flipbook 用 AI 重新定义了这个界面形态:不再是工程师预先写好的页面,而是根据用户意图即时生成的视觉表达。从预先录制的电视节目到实时互动的直播,内容不再是固定的,而是随需求变化的。

这个方向是有价值的,但我对它短期内替代传统 Web 持保留态度。纯图片界面在信息密度、交互精度、无障碍访问、搜索索引等方面都劣于 DOM 界面。Flipbook 更可能成为一个补充性的信息探索工具,而不是 Web 的替代品。它最适合的场景是开放式的知识探索和学习,而不是需要精确操作和高效率的任务型场景。

界面从被构建走向被生成,这个趋势是真实的。但生成式界面和结构化界面会长期共存,各有适用场景。Flipbook 的价值在于它率先证明了生成式界面的可行性,为这个方向提供了一个具体的产品参考。

扫描二维码分享