参考消息
例如,汉字“中”在 Unicode 中的码点是 U+4E2D;如果采用 UTF-8 存储,它会转换为 E4 B8 AD;如果采用 GBK,则通常表示为 D6 D0。它们显示的是同一个汉字,但底层字节不同。跨平台出现乱码,往往不是中文字符本身有问题,而是写入、传输或读取时采用了不同的编码规则。
计算机处理中文时,通常要经过三个层次。第一层是字符,例如“中”“文”;第二层是字符集或字符编码体系,用来规定字符与代码之间的对应💎关系;第三层是⭐具体字节,用于文件、数据库、网络接口或程序内存中的存储和传递。
字符转换不是简单地修改文件后缀,也不是把一串乱码直接替换成可见文字。正确过程是先按照原编码解码成内部字符,再按照目标编码重新编码。
新项目通常可以把 UTF-8 作为统一默认值,因为它对英文兼容性较好,也便于不同语言、系统和平台之间交换数据。对于必须兼容旧系统的场景,应在边界处完成 GBK 或 GB18030 与 Unicode、UTF-8 之间的转换,程序内部尽量使用统一的 Unicode 字符表示。
还要注意,URL 百分号表示、Base64 和转义符并☀️不等同于中文字符编码。它们可以对已经编码后的字节进行再次包装,但不能替代 UTF-8、GBK 等字符编码规则。遇到“中文有码”这类说法时,最重要的是继续追问具体的字符集、编码格式和数据所在环节,这样才能准确判断如何存储、转换和传输中文。
编码约定至少应写清楚四件事:字符数据的内部表示、文件保存格式、接口传输格式、数据库连接字符集。对每个输入来源都明确“按什么编码读”,对每个输出目标都明确“按什么编码写”,比依赖系统默认值更可靠。