Python基础之字符的编码

参考原文

为什么要进行编码？

　　计算机只能处理二进制数字(0100111),要处理文本，就必须先把文本转为数字才能处理，这个过程就叫编码。

字符的编码

ASCII编码

　　由于计算机是美国人发明的,最早只有127个字符被编码到计算机里，包括大小写英文字母、数组和一些符号，这个编码表被称为ASCII编码，比如大写字母A的编码是65，小写字母z的编码是122。

　　但是用来处理中文显然一个字节是不够的，至少需要2个字节，而且不能和ASCII原有的编码冲突。所以中国制定了GB2312编码来将中文编进去。但是可以想象，全世界有上百中语言，各国有各国的标准，日本把日文编到Shift_JIS里，韩国把韩文编到Euc-kr里。这肯定会出现冲突，结果就导致在多语言的混合的文本中显示出来会有乱码。

Unicode编码

　　因此，Unicode应运而生。Unicode将所有的语言都统一到一套编码里，这样就不会有乱码问题了。Unicode标准也在不断发展，但最常用的是用2个字节表示1个字符（偏僻的字符，就需要4个字节）

ASCII和Unicode区别：ASCII编码是一个字节代表一个字符，Unicode2个字节表示一个字符，对于汉字来说超出了ASCII的编码范围，对于英语字母两者皆可编码，但Unicode编码就要比ASCII编码多用一倍的存储空间。所以引出了下面的编码方式。

UTF-8编码

　　UTF-8编码（可变长编码）把一个Unicode字符根据不同的数字大小编码成1-6个字节，常用的英文字母被编码成1个字节，汉字通常是3个字节，只有生僻的字符才会被编码成4-6个字节。ASCII编码实际上是UTF-8编码的一部分。

比较

　　在计算机内存中统一使用Unicode编码，当需要保存到硬盘或传输的时候，就转换为UTF-8编码。例如：用记事本编辑的时候，从文件读取的UTF-8字符被转换为Unicode字符到内存里，编辑完成后，保存时又将Unicode字符转换为UTF-8保存到文件中。