第三章 | 字符集和比较规则
字符集和比较规则
字符集简介
将字符映射成二进制数据的过程叫做编码,将二进制数据映射到字符串的过程叫做解码。
字符集举例
ASCII字符集:共收录128个字符,包括空格、标点符号、数字、大小写字母和一些不可见字符。由于ASCII字符集总共才128个字符,所以使用一个字节来编码。
'L' —> 01001100
'M' —> 01001101
ISO-8859-1字符集:在ASCII基础上又扩充了128个西欧常用字符(包括德法两国的字母)总共256个字符,别名Latin1。ISO-8859-1字符集也可以使用一个字节来进行编码。
GB2312字符集:收录了汉字以及拉丁字母、希腊字母、日文平假名以及假名字母、俄语西里尔字母,收录汉字6763个收录其他文字符号682个。该字符集同时兼容ASCII字符集,如果该字符在ASCII字符集中则采用一字节编码,否则采用两字节编码。
MySQL中支持的字符集和比较规则
utf8mb3: “阉割”过的UTF-8字符集,只是用1~3个字节表示字符
utf8mb4:正宗的UTF-8字符集使用1~4个字节表示字符。
在MySQL中utf8是utf8mb3的别名,如果有使用4字节编码一个字符的情况,如emoji表情请使用utf8mb4。
字符集查看
show [character set | charset];
show charset;| Charset | Description | Default collation | Maxlen |
|---|---|---|---|
| armscii8 | ARMSCII-8 Armenian | armscii8_general_ci | 1 |
| ascii | US ASCII | ascii_general_ci | 1 |
| big5 | Big5 Traditional Chinese | big5_chinese_ci | 2 |
| binary | Binary pseudo charset | binary | 1 |
| cp1250 | Windows Central European | cp1250_general_ci | 1 |
| cp1251 | Windows Cyrillic | cp1251_general_ci | 1 |
| cp1256 | Windows Arabic | cp1256_general_ci | 1 |
| cp1257 | Windows Baltic | cp1257_general_ci | 1 |
| cp850 | DOS West European | cp850_general_ci | 1 |
| cp852 | DOS Central European | cp852_general_ci | 1 |
| cp866 | DOS Russian | cp866_general_ci | 1 |
| cp932 | SJIS for Windows Japanese | cp932_japanese_ci | 2 |
| dec8 | DEC West European | dec8_swedish_ci | 1 |
| eucjpms | UJIS for Windows Japanese | eucjpms_japanese_ci | 3 |
| euckr | EUC-KR Korean | euckr_korean_ci | 2 |
| gb18030 | China National Standard GB18030 | gb18030_chinese_ci | 4 |
| gb2312 | GB2312 Simplified Chinese | gb2312_chinese_ci | 2 |
| gbk | GBK Simplified Chinese | gbk_chinese_ci | 2 |
| geostd8 | GEOSTD8 Georgian | geostd8_general_ci | 1 |
| greek | ISO 8859-7 Greek | greek_general_ci | 1 |
| hebrew | ISO 8859-8 Hebrew | hebrew_general_ci | 1 |
| hp8 | HP West European | hp8_english_ci | 1 |
| keybcs2 | DOS Kamenicky Czech-Slovak | keybcs2_general_ci | 1 |
| koi8r | KOI8-R Relcom Russian | koi8r_general_ci | 1 |
| koi8u | KOI8-U Ukrainian | koi8u_general_ci | 1 |
| latin1 | cp1252 West European | latin1_swedish_ci | 1 |
| latin2 | ISO 8859-2 Central European | latin2_general_ci | 1 |
| latin5 | ISO 8859-9 Turkish | latin5_turkish_ci | 1 |
| latin7 | ISO 8859-13 Baltic | latin7_general_ci | 1 |
| macce | Mac Central European | macce_general_ci | 1 |
| macroman | Mac West European | macroman_general_ci | 1 |
| sjis | Shift-JIS Japanese | sjis_japanese_ci | 2 |
| swe7 | 7bit Swedish | swe7_swedish_ci | 1 |
| tis620 | TIS620 Thai | tis620_thai_ci | 1 |
| ucs2 | UCS-2 Unicode | ucs2_general_ci | 2 |
| ujis | EUC-JP Japanese | ujis_japanese_ci | 3 |
| utf16 | UTF-16 Unicode | utf16_general_ci | 4 |
| utf16le | UTF-16LE Unicode | utf16le_general_ci | 4 |
| utf32 | UTF-32 Unicode | utf32_general_ci | 4 |
| utf8 | UTF-8 Unicode | utf8_general_ci | 3 |
| utf8mb4 | UTF-8 Unicode | utf8mb4_0900_ai_ci | 4 |
比较规则查看
show collation [like 匹配模式];
show collation like 'utf8\_%';| Collation | Charset | Id | Default | Compiled | Sortlen | Pad_attribute |
|---|---|---|---|---|---|---|
| utf8_bin | utf8 | 83 | Yes | 1 | PAD SPACE | |
| utf8_croatian_ci | utf8 | 213 | Yes | 8 | PAD SPACE | |
| utf8_czech_ci | utf8 | 202 | Yes | 8 | PAD SPACE | |
| utf8_danish_ci | utf8 | 203 | Yes | 8 | PAD SPACE | |
| utf8_esperanto_ci | utf8 | 209 | Yes | 8 | PAD SPACE | |
| utf8_estonian_ci | utf8 | 198 | Yes | 8 | PAD SPACE | |
| utf8_general_ci | utf8 | 33 | Yes | Yes | 1 | PAD SPACE |
| utf8_general_mysql500_ci | utf8 | 223 | Yes | 1 | PAD SPACE | |
| utf8_german2_ci | utf8 | 212 | Yes | 8 | PAD SPACE | |
| utf8_hungarian_ci | utf8 | 210 | Yes | 8 | PAD SPACE | |
| utf8_icelandic_ci | utf8 | 193 | Yes | 8 | PAD SPACE | |
| utf8_latvian_ci | utf8 | 194 | Yes | 8 | PAD SPACE | |
| utf8_lithuanian_ci | utf8 | 204 | Yes | 8 | PAD SPACE | |
| utf8_persian_ci | utf8 | 208 | Yes | 8 | PAD SPACE | |
| utf8_polish_ci | utf8 | 197 | Yes | 8 | PAD SPACE | |
| utf8_romanian_ci | utf8 | 195 | Yes | 8 | PAD SPACE | |
| utf8_roman_ci | utf8 | 207 | Yes | 8 | PAD SPACE | |
| utf8_sinhala_ci | utf8 | 211 | Yes | 8 | PAD SPACE | |
| utf8_slovak_ci | utf8 | 205 | Yes | 8 | PAD SPACE | |
| utf8_slovenian_ci | utf8 | 196 | Yes | 8 | PAD SPACE | |
| utf8_spanish2_ci | utf8 | 206 | Yes | 8 | PAD SPACE | |
| utf8_spanish_ci | utf8 | 199 | Yes | 8 | PAD SPACE | |
| utf8_swedish_ci | utf8 | 200 | Yes | 8 | PAD SPACE | |
| utf8_tolower_ci | utf8 | 76 | Yes | 1 | PAD SPACE | |
| utf8_turkish_ci | utf8 | 201 | Yes | 8 | PAD SPACE | |
| utf8_unicode_520_ci | utf8 | 214 | Yes | 8 | PAD SPACE | |
| utf8_unicode_ci | utf8 | 192 | Yes | 8 | PAD SPACE | |
| utf8_vietnamese_ci | utf8 | 215 | Yes | 8 | PAD SPACE |
utf8_general_ci是以ci结尾的,说明不区分大小写
一种字符集可能对应若干比较规则。,且每种字符集都有一种默认的比较规则。default列为YES的比较规则就是该字符集的默认比较规则。
字符集合比较规则的应用
各级别字符集比较规则
服务器级别
MySQL提供了两个系统变量来表示服务器级别的字符集和比较规则如下:
系统变量 描述 character_set_server 服务器级别的字符集 collation_server 服务器级别的比较规则 查看系统变量值
sqlSHOW VARIABLES LIKE 'character_set_server';Variable_name Value character_set_server utf8mb4 SQLSHOW VARIABLES LIKE 'collation_server';Variable_name Value collation_server utf8mb4_0900_ai_ci 服务器级别修改字符集和比较规则可以通过启动项或者在服务器运行程序运行过程中使用SET语句修改这两个变量的值。
配置文件中修改如下:
yaml[server] character_set_server=gb2312 collation_server=gb2312_chainese_ci数据库级别
在创建数据库是可以指定数据库的字符集和比较规则,语法如下:
sqlCREATE TABLE [database name] [[DEFAULT] CHARACTER SET 字符集名称] [[DEFAULT] collate 比较规则名称];修改字符集和比较规则,语法如下:
sqlALTER TABLE [database name] [[DEFAULT] CHARACTER SET 字符集名称] [[DEFAULT] collate 比较规则名称];其中DEFAULT可以省略,eg:
sqlCREATE DATABASE charset_demo_db CHARACTER SET gb2312 COLLATE gb2312_chainese_ci表级别
在创建和修改表的时候指定表的字符集和比较规则,语法如下:
sql-- 创建 CREATE TABLE 表名(列信息) [[DEFAULT] CHARACTER SET 字符集名称] [COLLATE 比较规则名称]; -- 修改 ALTER TABLE 表名 [[DEFAULT] CHARACTER SET 字符集名称] [COLLATE 比较规则名称];eg:
sqlUSE charset_demo_db; CREATE TABLE t(col varchar(10)) CHARACTER SET utf8 COLLATE utf8_general_ci;建表时如果没有指定字符集和比较规则则继承表所属数据库字符集和比较规则。
列级别
在创建和修改列的时候可以指定该列的字符集和比较规则,语法如下:
sql-- 创建 CREATE TABLE 表名( 列名 字符串类型[CHARACTER SET 字符集名称] [COLLATE 比较规则名称], 其他列... ); -- 修改 ALTER TABLE 表名 MODIFY 列名 字符串类型 [CHARACTER SET 字符集名称] [COLLATE 比较规则名称];eg:
sqlALTER TABLE t MODIFY col VARCHAR(10) CHARACTER SET gbk COLLATE gbk_chinese_ci;仅修改字符集或仅修改比较规则
由于字符集和比较规则之间相互关联,因此只修改字符集,比较规则也会跟着变化,如果只修改比较规则字符集也会跟着变化。
只修改字符集,比较规则则会变化为修改后字符集的默认比较规则。
只修改比较规则,字符集则会变为修改后的比较规则对应的字符集。
