AI 为什么还改不好图片里的中文?

2026-07-29

最近一直在研究一个问题:为什么我不相信 AI 很快就能彻底解决图片里的中文问题。

很多人的观点是,再过一两代模型,中文自然就不会乱码了。但我的看法恰恰相反。

现在主流的 AI 图片生成,本质上是在预测每一个像素应该长什么样。对于它来说,一个汉字和一片树叶、一块砖墙、一团纹理没有本质区别,它是在“画”文字,而不是“写”文字。

这也是为什么,改两个字,旁边几个字可能一起变了;让它生成一段中文,总会出现一些似是而非的笔画。因为它理解的是图像,而不是文字本身。

英文还能勉强依靠 26 个字母和人脑自动补全,但中文有几千个常用汉字,每一个字都是高度精确的符号,只要一笔错,整个字就变了。

所以我越来越觉得,这可能不是模型大小的问题,而是生成方式的问题。

也正因为如此,我最近反而开始研究另一个方向:不是等待 AI 把中文做到完美,而是思考如何把 AI 已经生成好的图片重新变成可编辑、可修改、可复用的内容。

很多人都在追求更强的生成能力,但也许未来会诞生一类新的工程,它们并不负责“生成”,而是负责“理解 AI 已经生成的结果”,让这些原本一次性的图片,重新拥有编辑能力。

我越来越觉得,这条路未必只是一个补丁,它可能会成为 AI 时代新的基础设施。