从 Sora 看 AI 多模态:作为后端程序员我的几点思考
2026-06-07 · 思考与成长
Sora 的出现让多模态成了一个热词。作为一个只会写后端代码的程序员,聊聊我觉得这件事会怎么影响我未来的工作。
标签:多模态、Sora、GPT-4o、视频生成、AI趋势
一个后端程序员的困惑
说实话,Sora 刚出来的时候我看了一眼那支生成的视频,第一反应是——这和我一个写 Java 后端的有啥关系?
我每天打交道的是 SQL、Redis、消息队列、接口返回码。视频生成?那不是算法工程师的事吗?
但后来我慢慢觉得,可能不止那么简单。

我理解的多模态
简单说,"多模态"就是——**AI 不再只认文字,它能看图、听声音、看视频了。
之前的大模型,你只能和它用文字聊天。现在的多模态模型:你能输入的有文字、图片、声音、视频;它能输出的也有文字、图片、声音、视频。
和我一个后端开发有什么关系
我一开始真的觉得没关系。但后来我发现,即便是后端,也会被这件事影响:
1. 系统的输入和输出变丰富了
之前写后端,我们处理的数据类型大多是:字符串、数字、JSON。
未来,我们可能要处理:用户上传的图片让模型识别、用户上传的音频让模型转写、用户上传的视频让模型理解内容、输出一张图片(生成报告封面)、输出一段音频(把一段文字转成语音)。
这些东西之前是"上传到 OSS,返回 URL 给前端"。现在可能要变成"上传 → 调模型处理 → 返回处理结果"。流程变了,架构也变了。
2. 数据存储的挑战
之前存的是 JSON,几个字段。未来你可能要存:图片的特征向量、视频的帧信息、音频的文本转写。这些数据量都比文本大得多。
3. 接口设计要重新想
之前的接口同步返回就行。未来处理视频、图片可能耗时不是几百毫秒,而是几十秒甚至几分钟——异步处理、消息队列、任务状态追踪的能力会变得更重要。
这恰恰是后端程序员的强项。
我看到的一些可能的机会
- 异步处理会变得更重要:视频生成/图片理解这类任务,同步接口基本不现实。
- 数据管道(Data Pipeline)会越来越复杂:一个多模态的应用,数据流动往往是用户上传视频 → 切片 → 抽帧 → 向量化 → 入库 → 用户查询 → 检索 → 拼接上下文 → 生成回答 → 返回。
- 成本会成为一个大问题:调用一次多模态模型的成本,可能是调用一次文本模型的几十上百倍。
我觉得短期内不会发生的事
- 不会所有后端都被迫去做 AI 多模态。大部分系统还是传统的 CRUD。
- 不会所有人都需要去训练模型。大部分人是调用模型 API。
- 不会所有公司都需要有自己的多模态模型。大部分公司的正确做法是用大厂的 API。
我打算怎么准备
我给自己定的方向是:
- 把本职工作做好——把 Java、Spring、数据库、分布式这些东西学扎实,这些是基本功。
- 了解多模态的能力边界——知道它能做什么、不能做什么、成本大概是多少。
- 在现有的项目里找机会用上——比如在系统的运维监控里加上图片理解的能力,或者在客服系统里加上语音转写功能。
- 保持关注,但不焦虑——技术更新太快了,你追不上的,知道大概有什么、能用在哪就够了。
写在最后
Sora 刚出来的时候,我感觉很焦虑:"我是不是又要被淘汰了?"
但冷静下来一想,**每次技术革命,淘汰的都是"只会一种东西且不再学习的人",而不是"有扎实基本功的人"。
互联网出来的时候有人被淘汰,也有人抓住机会;云原生出来的时候有人被淘汰,也有人抓住机会;AI 多模态出来的时候,也会是一样的剧本。
焦虑没用,动手有用。