2026 跨界必读!谷歌多模态 '组合拳' 实战,4 大场景带你转型“跨学科复合体”!

谷歌多模态实战,4 大场景带你转型“跨学科复合体”!

文档更新 · 2025-12-299 min read
大家好!我是瓜哥,前互联网技术总监,现专注于 AI 编程领域的探索和分享。

想成为一名优秀的独立开发者和自媒体博主,需要成为一名 “通才”。技术我懂,但这远远不够,还要会设计,写文案,录音和拍视频。

在没有AI之前,这样的综合能力放在一个人身上,基本是妄想。

直到我真正推开了 “多模态” 的大门:AI再也不只是个聊天框,而是拥有视觉、听觉、跨文件类型的超级工具。

接下来,我将分享 4 个我日常使用的真实场景,希望能给你带去一些AI价值落地的参考。

看完你能学到什么

你将学会如何利用 AI 抹平跨学科鸿沟,一个人完成复杂任务的交付闭环。

4 个价值场景,向你详解如何进行 大模型多模态能力组合,每个都能直接复用:

  1. 设计稿 → 代码 ,0 基础,一条龙从设计到代码生成。
  1. 视频 → 多平台内容 ,一次创造,AI工作流完成多平台适配和分发。
  1. 数据 → 分析报告 ,不懂数据也能进行数据洞察,图文并茂一眼看懂。
  1. 想法 → 产品原型 ,25 年最热的AI编程,快速上手实战案例。

这是 Antigravity 系列的 第 05 期,介绍 谷歌全家桶 多模态能力。

关注我,持续更新 AI 编程实战。


场景一:一条龙从设计稿到代码生成

对于一个完全不懂设计的人来说,打开 Figma,量尺寸,扒颜色,写代码,调样式,直接从入门到放弃。

虽然AI编程工具也可以生成 html 代码的 UI 设计稿,但纯靠文字提示词去盲抽 UI 代码,真到了改细节的时候,直接让人抓狂。

经过我近期的摸索,现推荐一套组合给你:

Stitch(设计稿) + Antigravity(代码)

其中Stitch负责UI设计,你只需要描述你的想法; 而Antigravity负责写代码,基于 UI1:1 帮你实现功能。

全程AI辅助,跳过设计和写代码门槛,唯一考察你的只剩审美。

Demo - 骑行APP

01 我的需求

1. 帮我生成一个骑行爱好者的应用设计 2. 有欢迎页,介绍应用并突出主要功能 3. 有用户注册页面,骑行线路选择页面,允许用户从各种骑行线路中进行选择 4. 有徒步详情页,还有一个设置页 5. 希望是UI设计里选择图片精美,整体设计简洁,字体美观

02 概览 UI 设计

就这么简单的提示词,并没有指定色系和其他细节,它就能交付出这么精美的设计。

03 功能实现

有了这个UI 设计稿,粘贴丢给 Antigravity ,只需要说:请按 UI 设计稿,实现App首页。就这么简单!

Demo - 提示词集合网站

01 我的需求

1. 生成一个个人的“提示词聚合网站” 2. 网站风格冷静、简洁、图片精美、文字美观 3. 包含前端的展示页面和后端的管理页面 4. 前端页面包含卡片式的提示词,点击提示词可进入详情页面 5. 每个提示词卡片都有一个复制按钮,另外页面上支持卡片以最新\最热进行排名

02 概览 UI 设计

几分钟一个提示词Web网站的设计稿就出来了。

接下来就直接丢到Antigravity里让它实现就好了。

场景二:一次创作多平台适配/分发

所有做自媒体的,肯定都希望能一次投入,快速多平台适配和分发。

我的做法是:把一个录制好的视频丢给谷歌AIStudio,选择Gemini 3 Pro,让它帮:

  1. 提取视频里的语音
  1. 将语音转为文字,提炼出标题和概要
  1. 通过本地自己搭的AI工作流,变成小红书图卡和公众号图文,快速分发

让我们一起来看看,具体怎么操作的。

Demo - 教程视频一键转小红书图卡

我前段时间,做了个介绍Gemini 3 Flash的教程视频,大概 14 分钟。有了这个素材基础,直接提取视频语音和文字,再生成小红书 3:4 比例尺寸的图卡。

01 主要步骤

  1. 视频丢给 AI Studio
  1. AI 提取音频,转成文字
  1. 我用本地工具生成配图
  1. 适配小红书格式

02 给 AI 的提示词

分析这个教程视频: 1. 提取音频,转成文字 2. 生成 5 个核心知识点 3. 每个知识点一句话说明

03 AI 提取音频/提炼要点

仅29秒,视频内容就全部解析完成,并完成了5个核心知识点的提取,包括标题和说明。

## 核心知识点 1. 核心定位与新功能 Gemini 3 Flash 被定位为拥有“Pro 级智能、Flash 级速度”的模型,不仅保留了核心推理能力,还新增了可控制思考层级(Thinking)的功能。 2. 基准测试表现 在 MMMU-Pro(多模态理解)和 SWE-bench(代码生成与修复)等权威测试中,3 Flash 的得分持平甚至略高于 Gemini 3 Pro,表现优异。 3. 价格与性价比 其使用成本仅为 Gemini 3 Pro 的四分之一,虽然相比 2.5 Flash 价格有小幅上涨(输入涨67%,输出涨20%),但性能提升显著,性价比极高。 4. 实战开发对比 在“复古打字机”应用开发实测中,3 Flash 的代码生成速度比 3 Pro 快了近一倍,且在 UI 设计上对“复古”风格的理解比 Pro 更具悟性。 5. 多渠道上线 该模型已全面覆盖 Google 生态,用户可通过 Google AI Studio、Gemini App、Gemini CLI 命令行工具以及 Antigravity IDE 等多种渠道直接使用。

04 小红书图卡生成工作流

我本地用AI编程手搓了一个小红书图卡生成应用,输入文本,调用AI大模型,自动生成适配小红书3:4尺寸的图卡,支持9种图卡风格可选。

6 张图卡,1 分钟搞定。

了解生图详情:这套 0 成本 AI 工作流,让我实现了日更 100 篇!

Demo - 公众号文章 + 配图工作流

接着刚才的视频素材,我用Gemini CLI跑文章工作流,调谷歌 Nano BananaMCP搞定配图生成,最后复制粘贴发布。

Tips:如果你没有自己录制的视频,也可以从Youtube/B站下载一些素材使用,但要注意授权使用。

01 我的需求

基于提取的内容,生成公众号文章: 1. 标题(吸引眼球) 2. 开篇(引入话题) 3. 正文(详细笔记,带代码) 4. 总结(3 个要点)

02 任务执行

03 生成文章

运行本地AI写作工作流,2000 字文章搞定。

04 配图发布

在 Gemini CLI 里调用 Nano Banana,图片也快速搞定,最后复制粘贴发布,美滋滋。

了解公众号图文创建工作流:15 分钟 搞定全套公众号配图?Gemini CLI + Nano Banana 构建你的生图流水线!

场景三:不懂数据也能洞察

以前数据分析是个技术活儿,我是一个连Excel都玩不转的人,更别说更复杂的数据分析工具了。

现在有了AI,数据分析只是我日常基操。

Demo - 汽车销售分析

这是一份来自开源数据集的汽车销售数据,大概有 1500 条数据,涉及年份、品牌、型号、配置、车身类型、变速箱、VIN、车况、里程、颜色、内饰、卖家、MMR(市场参考价)、销售价格、销售日期等维度。

01 我的需求

综合分析这些材料,生成销售分析报告: 1. 销售趋势(哪些车型卖得好) 2. 价格分析(价格和销量的关系) 3. 客户反馈(从录音提取) 4. 改进建议(3 条,含数据支撑)

02 数据洞察

## 核心发现 1. SUV 销量增长 35%,轿车下滑 15% 2. 20-30 万价格区间最畅销 3. 客户最关心:油耗(提及 18 次)、空间(提及 15 次) ## 改进建议 1. 增加 SUV 车型配置(数据:SUV 增长 35%) 2. 优化 20-30 万价格段产品(数据:占总销量 45%) 3. 强化油耗宣传(数据:客户提及 18 次)

02 图表生成

最让我震撼的是,不仅对表格内容做了分析提炼,还生成了图表。这种查看信息比枯燥的表格更直观,更适合分发给团队的小伙伴。

有兴趣,也可以试试,数据源地址在这:

https://www.kaggle.com/datasets/syedanwarafridi/vehicle-sales-data?resource=download

场景四:从想法到原型上手实战

想做个小工具,验证一个想法。AI编程帮你挪开了不会写代码的这种大山,现在只需要你能用文字描述清楚想法,剩下就看AI发挥就行。

Demo - 一份与众不同的个人简历

如果你不希望使用千篇一律的招聘网站的简历模版,你完全可以自己打造一份与众不同的简历。我以技术工程师职位为例,做了一份技术风格强烈的个人简历。

输入我的要求

实现简历网站: - 个人信息、工作经历时间线 - 技能雷达图、项目卡片 - 联系方式 - 现代风格,科技感,响应式

简历首页

工作经历

工作技能

项目展示

联系方式

以我以前招人的经验来说,同样的两个候选人,一个只有文字描述的能力,一人直接给我发个了过往项目集,那么从一开始我就会更倾向选择后者。

Demo - 个人音乐播放器

虽然现在音乐软件很成熟了,但我们依然可以依靠AI编程,生成一个完全个性化的音乐播放器,还能加载自己喜欢的歌单。

这次我用Antigravity + Gemini 3 Pro,来完成这个项目。

几分钟后,一个简洁的个人音乐网站就这样出现了。不得不说,Gemini 3 的审美是非常在线的。

我还让它对接了我的网易云音乐的歌单,来一首 揽佬 的爆火歌曲:大展宏图

相信通过前面的案例和AI 多模态能力的组合,让我们从一个单一技能的个人,变成了拥有跨学科复合型的人,这时你的生产力将能获得极大的提升,可以做很多以前你根本不敢的想的事。

工具汇总说明

Stitch - 解决了设计的问题

  • https://stitch.withgoogle.com/
  • 免费(有配额)

Antigravity - 代码生成,浏览器自动化

  • https://antigravity.google
  • 免费(公测期)

AI Studio - 音视频分析,跨模态理解

  • https://aistudio.google.com
  • 免费(有配额)

Gemini CLI - 命令行批处理

  • npm install -g @google/gemini-cli
  • 免费(需 API Key)

我的使用原则

  1. AI 做执行,我做决策 - AI 生成,我 Review
  1. 关键数据必须验证 - 代码要测试,数据要核对
  1. 敏感信息不上传 - 商业机密、个人隐私都不传

写在最后

穿过 AI 的喧嚣,我们还是要回归到本质的问题:我们用 AI 能干什么?

我认为真正的价值在于,深入到一个个具体的需求场景里,利用 AI 多模态协作交付业务结果。不管是帮你工作提效,能让能你早点下班,还是提升你的综合技能,实现跨专业交付 “复杂结果” 的能力。这才是个人在 AI 时代个人的 核心竞争力。

评论区

暂无公开评论

还没有公开评论。

提交反馈

图文2026 跨界必读!谷歌多模态 '组合拳' 实战,4 大场景带你转型“跨学科复合体”!

反馈类型

请等待管理员审核,通过后将显示在评论区。

0 / 500