字符集与编码

本贴最后更新于 2529 天前,其中的信息可能已经东海扬尘

一、基本概念

1. charset(character set)字符集

2. encoding(character encoding):字符编码,简称编码

3. MBCS。。。
双字节字符集(DBCS,Double Byte Charecter Set)
,指一系列汉字字符集,包括 GB 2312,GBK,GB 18030,BIG5 等;

4. ANSI(American National Standard Institite),美国国家标准协会。各个国家(非拉丁语系国家)自己制定自己的字符集,符合 ANSI 的标准(即兼容 ASCII 字符集,在此基础上扩展),得到 ANSI 的认可,全世界在表示对应国家文字的时候都通用这种编码就叫 ANSI 编码。
  ANSI 问题:编码重叠问题--要同时显示多种语言,可能会出现一个编码两个字符集里面都有对应,计算机无法判断该显示哪一个。

代码页

5. 简单编码模型

  按照惯例,人们认为字符集和字符编码是同义词,因为使用同样的标准来定义提供什么字符并且这些字符如何编码到一系列的代码单元(通常一个字符一个单元)。由于历史的原因,MIME 和使用这种编码的系统使用术语字符集来表示用于将一组字符编码成一系列八位字节数据的整个系统。

  在简单编码模型里,一个字符集定义了这个字符集里包含什么字符,同时把每个字符在计算机中的比特表示也进行了定义。例如 ASCII,在 ASCII 里直接定义了 A -> 0100 0001。

6. 现代编码模型

  现代编码模型由统一码(Unicode)和通用字符集(UCS,Universal Character Set)构成。
  现代编码模型自底向上分为五个层次:

(1)抽象字符表 ACR (Abstract Character Repertoire)

  抽象字符表是一个系统支持的所有抽象字符的集合。

(2)编码字符集 CCS (Coded Character Set)

  将抽象字符表中的每一个字符用一个非负整数表示。抽象字符表及映射的码位值称为编码字符集。
  编码空间(encoding space):包含所有字符的表的维度,例如 ASCII 的编码空间为 128。
  码位(code point):编码空间的一个位置。
  码位值(code point value):一个字符映射到编码空间的码位。

  Unicode 属于这一层。

(3)字符编码表 CEF (Character Encoding Form)

  将编码字符集的非负整数值(即码位)转换成有限比特长度的整型值(称为码元 code units)的序列。

  UTF-8、UTF-16、UTF-32 等属于这一层。

(4)字符编码方案 CES (Character Encoding Schema)

(5)传输编码语法 TES (Transfer Encoding Syntax)

二、 各种字符集及其编码

1. ASCII 字符集

  美国信息交换标准代码(ASCII,American Standard Code for Information Interchange),128 个字符(26 个拉丁字符,10 个阿拉伯数字,59 个英式标点符号,33 个无法显示的控制字符)用于显示现代美国英语。
  0 - 127 表示 128 个 ASCII 字符,每个编码占 7 位。

2. EASCII 字符集

  延伸美国标准信息交换码(EASCII,Extended ASCII),256 个字符支持现代美国英语和部分西欧语言。
  0 - 255 表示 256 个 EASCII 字符,每个编码占 8 位。

3. ISO 8859 系列字符集

  ISO 8859,全称 ISO/IEC 8859。
  ISO 8859 字符集是一组字符集的总称,其下共包含了 15 个字符集,即 ISO 8859-n,其中 n=1,...,11,13,...,16。

  (1)ISO 8859-1 字符集(Latin-1) - 西欧语言

  (2)ISO 8859-2 字符集(Latin-2) - 中欧语言

    ......

  (11)ISO 8859-11 字符集(Thai) - 泰语,从泰国的 TIS620 标准字集演化而来

  (13)ISO 8859-13 字符集(Latin-7 或 Baltic Rim)- 波罗的语族

    ......

  (16)ISO 8859-16 字符集(Latin-10) - 东南欧语言

4. GB 2312 字符集

  GB 2312,中华人民共和国国家标准简体中文字符集,又称为 GB 2312-80 或 GB0。
  GB2312 是对 ASCII 的中文扩展。
  GB 2312 标准共收录 6763 个汉字,其中一级汉字 3755 个,二级汉字 3008 个;同时收录了包括拉丁字母、希腊字母、日文平假名及片假名字母、俄语西里尔字母在内的 682 个字符。
  GB 2312 的出现,基本满足了汉字的计算机处理需要,它所收录的汉字已经覆盖中国大陆 99.75% 的使用频率。但对于人名、古汉语等方面出现的罕用字和繁体字,GB 2312 不能处理。

  小于等于 127 的字符的意义与原来 ASCII 编码相同;
  两个大于 127 的字符连在一起时,就表示一个汉字,前面的一个字节(称之为高字节)从 0xA1 用到 0xF7,后面一个字节(低字节)从 0xA1 到 0xFE;
  在 ASCII 里本来就有的数字、标点、字母都重新编了两个字节长的编码,这就是常说的”全角”字符,而原来在 127 号以下的那些就叫”半角”字符了。

5. GBK 字符集

  GBK,汉字内码扩展规范
  GBK 向下完全兼容 GB 2312 编码。支持 GB 2312 编码不支持的部分中文姓,中文繁体,日文假名,还包括希腊字母以及俄语字母等字母。不过这种编码不支持韩国字,也是其在实际使用中与 unicode 编码相比欠缺的部分。

  向下兼容 GB 2312;
    
6. GB 18030 字符集

  GB 18030,国家标准 GB 18030-2005《信息技术 中文编码字符集》。
  增加了几千个新的少数民族的字。

  向下兼容 GBK;

7. BIG5 字符集

  Big5,又称为大五码或五大码,是使用繁体中文(正体中文)社区中最常用的电脑汉字字符集标准,共收录 13,060 个汉字。
  Big5 虽普及于台湾、香港与澳门等繁体中文通行区。

8. Unicode 字符集

  Unicode(中文:万国码、国际码、统一码、单一码)是计算机科学领域里的一项业界标准。它对世界上大部分的文字系统进行了整理、编码,使得电脑可以用更为简单的方式来呈现和处理文字。
  Unicode 伴随着通用字符集的标准而发展,同时也以书本的形式对外发表。Unicode 至今仍在不断增修,每个新版本都加入更多新的字符。目前最新的版本为 2017 年 6 月 20 日公布的 10.0.0。

  (1)Unicode 编码
    
    用两个字节,也就是 16 位来统一表示所有的字符,对于 ASCII 里的那些“半角”字符,Unicode 保持其原编码不变,只是将其长度由原来的 8 位扩展为 16 位,而其他文化和语言的字符则全部重新统一编码。由于"半角"英文符号只需要用到低 8 位,所以其高 8 位永远是 0。

    问题:
    保存英文文本时会多浪费一倍的空间;
    16 位远远不够;
    

  (2)UTF-8(8-bit Unicode Transformation Format)编码
    
    编码规则:
    0xxxxxxx
    110xxxxx 10xxxxxx
    1110xxxx 10xxxxxx 10xxxxxx
    11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

  (3)UTF-16 编码
 
    编码规则:
    
    
    
    

  (4)UTF-32 编码
    
    
    
    
    
    
  
  

CodePage

base64

参考:
维基百科
https://stackoverflow.com/questions/2281646/whats-the-difference-between-encoding-and-charset
https://my.oschina.net/goldenshaw/blog/304493
https://www.zhihu.com/question/27562173
https://yq.aliyun.com/articles/63036
https://zhuanlan.zhihu.com/p/19857727
http://blog.csdn.net/softman11/article/details/6124345

  • Java

    Java 是一种可以撰写跨平台应用软件的面向对象的程序设计语言,是由 Sun Microsystems 公司于 1995 年 5 月推出的。Java 技术具有卓越的通用性、高效性、平台移植性和安全性。

    3169 引用 • 8208 回帖

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...

推荐标签 标签

  • jQuery

    jQuery 是一套跨浏览器的 JavaScript 库,强化 HTML 与 JavaScript 之间的操作。由 John Resig 在 2006 年 1 月的 BarCamp NYC 上释出第一个版本。全球约有 28% 的网站使用 jQuery,是非常受欢迎的 JavaScript 库。

    63 引用 • 134 回帖 • 733 关注
  • 招聘

    哪里都缺人,哪里都不缺人。

    189 引用 • 1056 回帖 • 2 关注
  • Sphinx

    Sphinx 是一个基于 SQL 的全文检索引擎,可以结合 MySQL、PostgreSQL 做全文搜索,它可以提供比数据库本身更专业的搜索功能,使得应用程序更容易实现专业化的全文检索。

    1 引用 • 191 关注
  • BAE

    百度应用引擎(Baidu App Engine)提供了 PHP、Java、Python 的执行环境,以及云存储、消息服务、云数据库等全面的云服务。它可以让开发者实现自动地部署和管理应用,并且提供动态扩容和负载均衡的运行环境,让开发者不用考虑高成本的运维工作,只需专注于业务逻辑,大大降低了开发者学习和迁移的成本。

    19 引用 • 75 回帖 • 618 关注
  • API

    应用程序编程接口(Application Programming Interface)是一些预先定义的函数,目的是提供应用程序与开发人员基于某软件或硬件得以访问一组例程的能力,而又无需访问源码,或理解内部工作机制的细节。

    76 引用 • 429 回帖
  • jsoup

    jsoup 是一款 Java 的 HTML 解析器,可直接解析某个 URL 地址、HTML 文本内容。它提供了一套非常省力的 API,可通过 DOM,CSS 以及类似于 jQuery 的操作方法来取出和操作数据。

    6 引用 • 1 回帖 • 476 关注
  • Spring

    Spring 是一个开源框架,是于 2003 年兴起的一个轻量级的 Java 开发框架,由 Rod Johnson 在其著作《Expert One-On-One J2EE Development and Design》中阐述的部分理念和原型衍生而来。它是为了解决企业应用开发的复杂性而创建的。框架的主要优势之一就是其分层架构,分层架构允许使用者选择使用哪一个组件,同时为 JavaEE 应用程序开发提供集成的框架。

    942 引用 • 1458 回帖 • 118 关注
  • 前端

    前端技术一般分为前端设计和前端开发,前端设计可以理解为网站的视觉设计,前端开发则是网站的前台代码实现,包括 HTML、CSS 以及 JavaScript 等。

    247 引用 • 1347 回帖
  • Hprose

    Hprose 是一款先进的轻量级、跨语言、跨平台、无侵入式、高性能动态远程对象调用引擎库。它不仅简单易用,而且功能强大。你无需专门学习,只需看上几眼,就能用它轻松构建分布式应用系统。

    9 引用 • 17 回帖 • 610 关注
  • 锤子科技

    锤子科技(Smartisan)成立于 2012 年 5 月,是一家制造移动互联网终端设备的公司,公司的使命是用完美主义的工匠精神,打造用户体验一流的数码消费类产品(智能手机为主),改善人们的生活质量。

    4 引用 • 31 回帖 • 4 关注
  • 又拍云

    又拍云是国内领先的 CDN 服务提供商,国家工信部认证通过的“可信云”,乌云众测平台认证的“安全云”,为移动时代的创业者提供新一代的 CDN 加速服务。

    21 引用 • 37 回帖 • 519 关注
  • 单点登录

    单点登录(Single Sign On)是目前比较流行的企业业务整合的解决方案之一。SSO 的定义是在多个应用系统中,用户只需要登录一次就可以访问所有相互信任的应用系统。

    9 引用 • 25 回帖
  • FreeMarker

    FreeMarker 是一款好用且功能强大的 Java 模版引擎。

    23 引用 • 20 回帖 • 437 关注
  • 服务

    提供一个服务绝不仅仅是简单的把硬件和软件累加在一起,它包括了服务的可靠性、服务的标准化、以及对服务的监控、维护、技术支持等。

    41 引用 • 24 回帖 • 10 关注
  • HBase

    HBase 是一个分布式的、面向列的开源数据库,该技术来源于 Fay Chang 所撰写的 Google 论文 “Bigtable:一个结构化数据的分布式存储系统”。就像 Bigtable 利用了 Google 文件系统所提供的分布式数据存储一样,HBase 在 Hadoop 之上提供了类似于 Bigtable 的能力。

    17 引用 • 6 回帖 • 58 关注
  • Swagger

    Swagger 是一款非常流行的 API 开发工具,它遵循 OpenAPI Specification(这是一种通用的、和编程语言无关的 API 描述规范)。Swagger 贯穿整个 API 生命周期,如 API 的设计、编写文档、测试和部署。

    26 引用 • 35 回帖 • 12 关注
  • BookxNote

    BookxNote 是一款全新的电子书学习工具,助力您的学习与思考,让您的大脑更高效的记忆。

    笔记整理交给我,一心只读圣贤书。

    1 引用 • 1 回帖 • 2 关注
  • Spark

    Spark 是 UC Berkeley AMP lab 所开源的类 Hadoop MapReduce 的通用并行框架。Spark 拥有 Hadoop MapReduce 所具有的优点;但不同于 MapReduce 的是 Job 中间输出结果可以保存在内存中,从而不再需要读写 HDFS,因此 Spark 能更好地适用于数据挖掘与机器学习等需要迭代的 MapReduce 的算法。

    74 引用 • 46 回帖 • 561 关注
  • Android

    Android 是一种以 Linux 为基础的开放源码操作系统,主要使用于便携设备。2005 年由 Google 收购注资,并拉拢多家制造商组成开放手机联盟开发改良,逐渐扩展到到平板电脑及其他领域上。

    334 引用 • 323 回帖 • 25 关注
  • QQ

    1999 年 2 月腾讯正式推出“腾讯 QQ”,在线用户由 1999 年的 2 人(马化腾和张志东)到现在已经发展到上亿用户了,在线人数超过一亿,是目前使用最广泛的聊天软件之一。

    45 引用 • 557 回帖 • 181 关注
  • LaTeX

    LaTeX(音译“拉泰赫”)是一种基于 ΤΕΧ 的排版系统,由美国计算机学家莱斯利·兰伯特(Leslie Lamport)在 20 世纪 80 年代初期开发,利用这种格式,即使使用者没有排版和程序设计的知识也可以充分发挥由 TeX 所提供的强大功能,能在几天,甚至几小时内生成很多具有书籍质量的印刷品。对于生成复杂表格和数学公式,这一点表现得尤为突出。因此它非常适用于生成高印刷质量的科技和数学类文档。

    9 引用 • 32 回帖 • 152 关注
  • Telegram

    Telegram 是一个非盈利性、基于云端的即时消息服务。它提供了支持各大操作系统平台的开源的客户端,也提供了很多强大的 APIs 给开发者创建自己的客户端和机器人。

    5 引用 • 35 回帖 • 1 关注
  • V2Ray
    1 引用 • 15 回帖 • 1 关注
  • Kubernetes

    Kubernetes 是 Google 开源的一个容器编排引擎,它支持自动化部署、大规模可伸缩、应用容器化管理。

    109 引用 • 54 回帖
  • 一些有用的避坑指南。

    69 引用 • 93 回帖
  • App

    App(应用程序,Application 的缩写)一般指手机软件。

    90 引用 • 383 回帖
  • 尊园地产

    昆明尊园房地产经纪有限公司,即:Kunming Zunyuan Property Agency Company Limited(简称“尊园地产”)于 2007 年 6 月开始筹备,2007 年 8 月 18 日正式成立,注册资本 200 万元,公司性质为股份经纪有限公司,主营业务为:代租、代售、代办产权过户、办理银行按揭、担保、抵押、评估等。

    1 引用 • 22 回帖 • 703 关注