从 Sora 看 AI 多模态:作为后端程序员我的几点思考

2026-06-07 · 思考与成长

Sora 的出现让多模态成了一个热词。作为一个只会写后端代码的程序员,聊聊我觉得这件事会怎么影响我未来的工作。

标签:多模态、Sora、GPT-4o、视频生成、AI趋势

一个后端程序员的困惑

说实话,Sora 刚出来的时候我看了一眼那支生成的视频,第一反应是——这和我一个写 Java 后端的有啥关系?

我每天打交道的是 SQL、Redis、消息队列、接口返回码。视频生成?那不是算法工程师的事吗?

但后来我慢慢觉得,可能不止那么简单。

视频生成的概念图:文字描述输入指向生成的视频画面,旁边有多个模态图标

我理解的多模态

简单说,"多模态"就是——**AI 不再只认文字,它能看图、听声音、看视频了。

之前的大模型,你只能和它用文字聊天。现在的多模态模型:你能输入的有文字、图片、声音、视频;它能输出的也有文字、图片、声音、视频。

和我一个后端开发有什么关系

我一开始真的觉得没关系。但后来我发现,即便是后端,也会被这件事影响:

1. 系统的输入和输出变丰富了

之前写后端,我们处理的数据类型大多是:字符串、数字、JSON。

未来,我们可能要处理:用户上传的图片让模型识别、用户上传的音频让模型转写、用户上传的视频让模型理解内容、输出一张图片(生成报告封面)、输出一段音频(把一段文字转成语音)。

这些东西之前是"上传到 OSS,返回 URL 给前端"。现在可能要变成"上传 → 调模型处理 → 返回处理结果"。流程变了,架构也变了。

2. 数据存储的挑战

之前存的是 JSON,几个字段。未来你可能要存:图片的特征向量、视频的帧信息、音频的文本转写。这些数据量都比文本大得多。

3. 接口设计要重新想

之前的接口同步返回就行。未来处理视频、图片可能耗时不是几百毫秒,而是几十秒甚至几分钟——异步处理、消息队列、任务状态追踪的能力会变得更重要。

这恰恰是后端程序员的强项。

我看到的一些可能的机会

我觉得短期内不会发生的事

我打算怎么准备

我给自己定的方向是:

  1. 把本职工作做好——把 Java、Spring、数据库、分布式这些东西学扎实,这些是基本功。
  2. 了解多模态的能力边界——知道它能做什么、不能做什么、成本大概是多少。
  3. 在现有的项目里找机会用上——比如在系统的运维监控里加上图片理解的能力,或者在客服系统里加上语音转写功能。
  4. 保持关注,但不焦虑——技术更新太快了,你追不上的,知道大概有什么、能用在哪就够了。

写在最后

Sora 刚出来的时候,我感觉很焦虑:"我是不是又要被淘汰了?"

但冷静下来一想,**每次技术革命,淘汰的都是"只会一种东西且不再学习的人",而不是"有扎实基本功的人"。

互联网出来的时候有人被淘汰,也有人抓住机会;云原生出来的时候有人被淘汰,也有人抓住机会;AI 多模态出来的时候,也会是一样的剧本。

焦虑没用,动手有用。