精品欧美一区二区三区在线观看 _久久久久国色av免费观看性色_国产精品久久在线观看_亚洲第一综合网站_91精品又粗又猛又爽_小泽玛利亚一区二区免费_91亚洲精品国偷拍自产在线观看 _久久精品视频在线播放_美女精品久久久_欧美日韩国产成人在线

JavaScript的內部字符編碼是UCS-2還是UTF-16

開發 前端
對于 JavaScript 使用的是 UCS-2 還是 UTF-16 這個問題,我找了很久,沒有發現一個權威的回答,我決定自己研究一下它。這個回答來自于你對 JavaScript 引擎或者對 JavaScript 語言的理解。

[[172052]]

對于 JavaScript 使用的是 UCS-2 還是 UTF-16 這個問題,我找了很久,沒有發現一個權威的回答,我決定自己研究一下它。這個回答來自于你對 JavaScript 引擎或者對 JavaScript 語言的理解。

一、著名的 BMP(Basic Multilingual Plane)

Unicode 標識符通過一個明確的名字和一個整數來作為它的碼位(code point).比如,“©” 字符的碼位可以用“版權標志”和U+00A9(0xA9,也可以寫作十進制 169)來表示。

Unicode 字符分為 17 組平面,每個平面擁有 2^16 (65,536)個碼位.有一些碼位沒有分配字符,也有一些碼位被保留,成為私有的,也有一些碼位是永遠被保留的,作為無字符的標志。每一個碼位都可以用 16 進制 xy0000 到 xyFFFF 來表示,這里的 xy 是表示一個 16 進制的值,從 00 到 10。

這第一個位置(當 xy 是 00 的時候)被稱為 BMP (基本多文種平面, Basic Multilingual Plane)。它包含了最常用的碼位從 U+0000 到 U+FFFF。

這里需要補充一點額外的平面知識,以及術語的表格。

 

 

引用自:wikipedia

其余 16號平面(U+100000 到 U+10FFFF)稱為補充的平面。這里我將不討論它;只需要記住兩個概念:BMP 字符和非 BMP 字符,后者也被稱為補充字符。

二、UCS-2 和 UTF-16 之間的不同

UCS-2 和 UTF-16 都是 Unicode 的字符編碼方式。

UCS-2(2個字節的通用字符集)是一種固定長度的編碼格式,只需要使用編碼為 16 字節編碼單元來表示碼位。這樣的表示結果將和 UTF-16 在 0 到 0xFFFF (BMP)范圍內大多數的結果一樣。

UTF-16(16 位 Unicode 轉換格式)是對 UCS-2 的一個擴展,它允許表示比 BMP 范圍內更多的字符。它是一種可變長度格式,它的每個碼位能夠使用 1 位或者 2 位 16字節編碼單元來表示。這種方式能夠編碼的碼位在 0 到 0x10FFFF 之間。

比如,在 UCS-2 和 UTF-16 中,對于 BMP 字符 U+00A9 版權標志(©)都能被編碼為:0x00A9。

這里補充一下 UCS-2、UCS-4、BMP

CPU 處理多字節數的方式分為:“大尾”(big endian)和“小尾”(little endian),簡單的理解就是一個 Unicode 編碼,比如6C49,寫到文件里面 6C 49 或者 49 6C,兩種方式,前者就叫“大尾”,后者就叫“小尾”。

UCS 可以分為兩種格式:UCS-2 和 UCS-4。UCS-2 使用兩個字節編碼,UCS-4 使用4個字節(實際只有 31 位,最高位必須是 0)編碼。

轉換關系:UCS-4 中高兩個字節為 0 的碼位稱為 BMP;UCS-4 的 BMP 去掉前面兩個零字節就得到 UCS-2;UCS-2 加上兩個零字節就得到 UCS-4 中的 BMP。

三、代理對(Surrogate pairs)

對于 BMP 之外的字符,比如 U+1D306 四條線居中(其實不好翻譯:tetragram for centre,?),只能使用 UTF-16 中兩個 16 字節來編碼:0xD834 0XDF06。這種就被稱為代理對。值得注意的是一個代理對只代表一個單字符。

補充一下代理對的概念

實際上就是指上面的一個 UTF-16 編碼,使用 2 個 16 字節來編碼。那是因為一個 UTF-16 編碼不夠,然后就應該使用 2 個 UTF-16 編碼來表示更多的字符。然后這樣就會出現:之前 2 個字節的空間表示一個字符,就會變成 4 個字節的空間。所以就規定只有一定范圍內使用 2 個 UTF-16 編碼來表示一個字符,這樣的方式就叫代理對,其余的依然使用 2 個字節來表示。

代理對中的第一個字符單元總是在 0xD800 到 0xDBFF 之間,稱為高位代理或者頂部代理(high surrogate or lead surrogate,暫時這樣,查到專業術語再翻譯)。第二個字符單元總是處于 0xDC00 到 0xDFFF 之間,稱為低位代理或者尾部代理(low surrogate or trail surrogate)。

UCS-2 是缺乏對代理對的支持的,所以要表示之前的字符需要使用 2 個分隔的字符。

四、碼位(code points)和代理對(surrogate pairs)之間的轉換

Section 3.7 of The Unicode Standard 3.0(pdf) 中定義了一個轉換算法。

假設:一個碼位 C 大于 0xFFFF 的編碼使用代理對 <H, L> 來表示的公式為: 

  1. H = Math.floor((C - 0x10000) / 0x400) + 0xD800 
  2. L = (C - 0x10000) % 0x400 + 0xDC00  

轉換公式變換后,比如從代理對 <H, L> 轉換成一個 Unicode 碼位 C,可以使用公式: 

  1. C = (H - 0xD800) * 0x400 + L - 0xDC00 + 0x10000 

五、Ok,那么關于 JavaScript 的編碼問題呢?

在 ECMAScript 中定義來怎樣解釋字符的問題.

在 level 3 或者更高等級的實現中,遵循國際標準,與 Unicode 3.0 標準或者更新的標準,以及 ISO/IEC 10646-1,和 UCS-2 或者 UTF-16 作為編碼格式。如果采用的 ISO/IEC 10646-1 自己未被指定,它被認定為 BMP 的自己,集合 300(這里沒懂)。如果沒有采用其它的編碼格式,那么將按照 UTF-16 進行編碼。

換句話說,JavaScript 引擎是允許使用 UCS-2 或者 UTF-16 進行編碼的。

然后按照 specific parts 規定,認為引擎里面的編碼需要一些 UTF-16 的知識。

當然,內部引擎對于大多數 JavaScript 開發者來說沒有實際影響。對于更多有趣的發現JavaScript 是如何考慮字符的 中,有一段:

盡管在本文檔的其它部分中,表示字符單元和文字字符將使用 16 位的無符號值,用來表示單個 16 位文本單元。Unicode 字符將使用抽象的語言或印刷單元(可超過16位,因此可以由多個代碼單元)來表示。碼位可以用 Unicode 標準值來表示。一個組合字符序列的成分可以有個別“Unicode 字符”,即使一個用戶可能會認為整個序列是單個字符。

可能需要重新翻譯,原文

Throughout the rest of this document, the phrase code unit and the word character will be used to refer to a 16-bit unsigned value used to represent a single 16-bit unit of text.

The phrase Unicode character will be used to refer to the abstract linguistic or typographical unit represented by a single Unicode scalar value (which may be longer than 16 bits and thus may be represented by more than one code unit).

The phrase code point refers to such a Unicode scalar value.

Unicode character only refers to entities represented by single Unicode scalar values: the components of a combining character sequence are still individual “Unicode characters”, even though a user might think of the whole sequence as a single character.

JavaScript 使用單獨字符來處理字符單元,然后人們通常認為是一組 Unicode 字符。當使用 BMP 范圍外 Unicode 字符的時候,這樣會有一些不好的結果。比如代理對使用 2 個字符單元組成:'?'.length == 2,即使這里是只有一個 Unicode 字符。如果是字符,代理對將暴露一部分:'?' == '\uD834\uDF06'。

在這里你想到了什么呢?對于這種方式,至少是 UCS-2 的替代方式(不同的地方是,UCS-2 不允許有代理字符,然后 JavaScript 字符串是這樣做的)。

你可以認為它像 UTF-16 一樣在工作,特別是分成兩部分的方式是被允許的,代理的這種錯誤排序是被允許的,代理被暴露成了分離的字符。我認為你將更容易的理解成這種行為叫“UCS-2 的代理方式”(UCS-2 with surrogates,不好翻譯,也可以理解成伴隨著代理的 UCS-2)。

類似 UCS-2 的行為對整個語言更有影響,比如 補充字符范圍的正則表達式 比那些支持 UTF-16 的語言要更難寫。

代理對只是為了顯示在瀏覽器中(layout 的時候),對單個 Unicode 字符的重新組合。這發生在 JavaScript 引擎的影響范圍之外。為了證明這個,你能在 document.write() 的時候分開寫一個高位代理和地位代理字符. 

  1. document.write('\uD834'); 
  2.  
  3. document.write('\uDF06');  

在結束后也將被渲染成一個圖案:?。

六、結論

JavaScript 引擎內部是自由的使用 UCS-2 或者 UTF-16。我所知道的大多數引擎使用的是 UTF-16,無論它們使用什么方式實現,它只是一個具體的實現,這不將影響到語言的特性。

然后對于 ECMAScript/JavaScript 語言本身,實現的效果是通過 UCS-2,而非 UTF-16。

如果你在任何時候需要 編碼一個 Unicode 字符, 在必要的時候能夠替換成分離的代理,也可以免費試用我的 JavaScript escaper 工具。

如果你想在一個 JavaScript 字符串中獲取 Unicode 字符的長度,或者創建一個基于 non-BMP Unicode 碼位的字符串,你能使用Punycode.js 的工具方法,將 UCS-2 字符串轉換成 UTF-16 碼位。

  1. // `String.length` 只是統計所以 Unicode 字符 
  2. punycode.ucs2.decode('?').length; // 1 
  3. // `String.fromCharCode` 能夠讓你直接使用非分離的代理 
  4. punycode.ucs2.encode([0x1D306]); // '?' 
  5. punycode.ucs2.encode([119558]); // '?'  

ECMAScript 6 在字符串中將支持一些新的編碼序列(現在看來已經 ok 了,可以查看一下資料簡單了解下),名為 Unicode code point escapes 比如:\u{1D306}。另外,它將定義 String.fromCodePoint 和 String#codePointAt,這兩個方法都接受碼位(code points) 而不是字符單元(code units)

感謝:Jonas ‘nlogax’ Westerlund, Andrew ‘bobince’ Clover 以及 Tab Atkins Jr.。他們給了我調查的靈感和幫助我。

提示:如果你喜歡閱讀關于 JavaScript 的內部字符編碼,可以 check out JavaScript has a Unicode problem,這里更詳細解釋了實際的問題,以及提供了解決方法。

責任編輯:龐桂玉 來源: segmentfault
相關推薦

2023-01-26 00:31:25

ASCIIBase64UTF-8

2021-05-12 07:43:02

LinuxUnicodeUTF-8

2021-04-11 10:19:45

Python編碼Unicode萬國碼

2011-08-25 09:43:51

UTF-8中文man

2025-02-18 01:00:00

Astro系統AI

2019-12-16 09:26:05

Java設計操作系統

2019-01-08 09:23:16

Java字符串編碼

2024-01-04 12:53:00

Unicode字符UTF-8

2009-06-30 14:22:50

Java編碼

2025-03-26 11:38:12

2010-10-08 10:26:45

JavaScript內

2019-04-28 13:12:38

AppJavaScriptNative

2010-09-29 11:29:18

UnicodeJ2ME

2009-06-08 19:52:47

Eclipse字符編碼

2011-03-21 13:01:10

2022-05-18 10:56:58

Java字符串編碼

2009-06-30 14:16:37

截取字符串

2024-05-28 14:36:32

AI編碼場景

2010-10-08 09:51:52

Mysql設置字符

2023-04-13 00:24:00

前端編碼JavaScrip
點贊
收藏

51CTO技術棧公眾號

国内成人自拍视频| 女同久久另类99精品国产| 国产精品久久久久久久第一福利 | 精品偷拍各种wc美女嘘嘘| 欧美黄色免费影院| 欧美激情午夜| 白白色 亚洲乱淫| 国产精品一区二区女厕厕| 久久久国产成人| 欧美日韩伦理在线免费| 精品国产一区二区三区久久影院 | ****av在线网毛片| 久久久www成人免费无遮挡大片| 国产日韩欧美在线看| 日韩激情在线播放| 色婷婷色综合| 日韩精品欧美国产精品忘忧草 | 国产成人av片| 五月婷婷综合在线观看| 成人久久网站| 精品久久久久久亚洲精品| 亚洲图色在线| 天天综合在线视频| 国内精品伊人久久久久av一坑| 97人人爽人人喊人人模波多| 欧美三级黄色大片| 女人丝袜激情亚洲| 国产真实乱子伦精品视频| 欧美日韩国产一级| 国产日韩一区二区在线| 中文字幕在线观看播放| 欧美国产成人在线| 久久综合婷婷综合| 动漫av一区二区三区| 激情另类小说区图片区视频区| 欧洲美女7788成人免费视频| 国产亚洲精品久久久久久打不开| 97精品国产| 在线观看国产精品日韩av| 国产毛片久久久久久久| 欧美国产极品| 亚洲高清av在线| 日批视频免费看| 精品一区91| 91麻豆精品国产91久久久久久 | 理论片午午伦夜理片在线播放| 久久伊99综合婷婷久久伊| 激情伦成人综合小说| 高清乱码毛片入口| 国产精品456| 99c视频在线| hs视频在线观看| 国内不卡的二区三区中文字幕 | 在线观看国产成人| 日韩—二三区免费观看av| 青青草一区二区| 男人天堂2024| 日韩国产成人精品| 国产精品偷伦视频免费观看国产| 精品成人无码久久久久久| 久久国产精品毛片| 国产精品mp4| 超碰在线97观看| 美腿丝袜亚洲综合| 成人激情黄色网| 99久久久久久久| 国产精品主播直播| 国产精品一区二区av| 神宫寺奈绪一区二区三区| 972aa.com艺术欧美| 欧美成人一区二区在线| 成人午夜影视| 亚洲欧洲日韩女同| av在线播放天堂| 亚洲精品永久免费视频| 91久久免费观看| 亚洲精品20p| 99精品中文字幕在线不卡| 欧美mv日韩mv| 中文幕无线码中文字蜜桃| 国产亚洲欧美日韩在线观看一区二区| 亚洲天堂2020| www日韩在线| 亚洲区一区二| 国产精品99久久久久久白浆小说| 一区二区三区精| 国产v综合v亚洲欧| 精品视频免费观看| 免费在线观看av| 午夜日韩在线观看| 蜜臀av免费观看| 日韩中文字幕一区二区高清99| 亚洲国产91精品在线观看| 精品欧美一区二区久久久| 欧美一区视频| 日韩av黄色在线观看| 国产精品免费无遮挡| 99久久综合国产精品| 中文字幕99| 国产在线美女| 欧美绝品在线观看成人午夜影视| 中文字幕天堂av| 精品久久精品| 久久久亚洲福利精品午夜| 免费看污视频的网站| 成人网页在线观看| 一级日韩一区在线观看| 老色鬼在线视频| 欧美一区二区三区在线观看| 波多野吉衣中文字幕| 中文精品久久| 国产精品精品视频一区二区三区| 日本精品久久久久久| 中文字幕五月欧美| 日韩网址在线观看| 超碰地址久久| 久久影院资源网| 国产精品尤物视频| av成人老司机| 欧美做暖暖视频| 高清电影一区| 亚洲剧情一区二区| 精品无码久久久久久久| 国产一区二三区好的| 欧美日韩在线一二三| 9999精品成人免费毛片在线看| 欧美日韩一区视频| xxxxx在线观看| 国产视频亚洲| 国产九区一区在线| 日韩特级毛片| 欧美一区二区三区不卡| 999久久久国产| 日精品一区二区| 久久久亚洲综合网站| 超碰97国产精品人人cao| 欧美一区二区三区婷婷月色| 精品无码一区二区三区蜜臀| 轻轻草成人在线| 日本一区免费看| www.com.cn成人| 亚洲精品久久久久国产| 久久9999久久免费精品国产| 国产精品18久久久久久久久 | 亚洲最大成人网站| 国产精品日本欧美一区二区三区| 国产在线一区二区三区播放| 久久香蕉一区| 亚洲国产女人aaa毛片在线| 国产精品免费av一区二区| 成人国产在线观看| www.avtt| 欧美电影完整版在线观看| 91国自产精品中文字幕亚洲| 少妇人妻精品一区二区三区| 狠狠久久五月精品中文字幕| wwwwww日本| 久久香蕉精品| 亚洲欧美精品| 疯狂欧洲av久久成人av电影| 欧美夫妻性生活xx| 亚洲aaaaaaa| 在线观看日产精品| 5566中文字幕| 国产99久久久精品| 欧美国产亚洲一区| 欧美三级三级| 91日本在线观看| 青春草免费在线视频| 亚洲第一网站免费视频| 亚洲精品国产无码| 国产精品久久二区二区| 黄色a级三级三级三级| 国产精品v欧美精品v日本精品动漫| 国产精品一区二区三区免费观看| 波多野结衣亚洲| 久久精品99久久久久久久久| 午夜精品一区二区三| 精品国产乱码久久久久久婷婷| 三上悠亚影音先锋| 国产一区二区三区四区五区入口| 91精品国产91久久久久麻豆 主演| 久久人人爽人人爽人人片av不| 国产成人小视频在线观看| 老司机午夜在线| 亚洲精品99久久久久| 亚洲天堂网在线视频| 亚洲一二三专区| 精品无码人妻一区二区免费蜜桃| 国内精品不卡在线| 久久久久狠狠高潮亚洲精品| 91视频久久| 精品乱子伦一区二区三区| 成人国产精选| 97久久超碰福利国产精品…| 1769在线观看| 亚洲国产天堂网精品网站| 中文字幕久久久久| 精品国产乱码久久久久久婷婷| 99久久久无码国产精品不卡| thepron国产精品| 天堂在线中文在线| 久久国产精品久久久久久电车| 日本黄网站色大片免费观看| 国产一区二区亚洲| 国产伦精品一区二区三区四区免费 | 国产精品成人一区二区艾草| 久久久老熟女一区二区三区91| 看国产成人h片视频| 免费看国产曰批40分钟| 羞羞色午夜精品一区二区三区| 精品麻豆av| 7777精品| 成人网页在线免费观看| 影视一区二区三区| 97热在线精品视频在线观看| 在线视频国产区| 视频在线观看一区二区| 日韩午夜影院| 日韩成人在线播放| 亚洲AV无码国产精品午夜字幕| 欧美亚洲国产一区在线观看网站| 国内免费精品视频| 亚洲永久精品国产| 91嫩草丨国产丨精品| 中日韩免费视频中文字幕| 香蕉网在线播放| 成人毛片视频在线观看| 中文字幕无人区二| 国产自产高清不卡| 一区二区在线免费看| 视频一区国产视频| 红桃av在线播放| 在线视频亚洲| 91成人在线观看喷潮教学| 亚洲激情精品| 福利视频一二区| 亚洲东热激情| 免费观看国产精品视频| 亚洲欧洲日本一区二区三区| 国产免费内射又粗又爽密桃视频| 婷婷亚洲五月色综合| 亚洲人成网站在线观看播放| 成人av国产| 五月天亚洲综合情| 91视频精品| 97超碰免费观看| 中文字幕av亚洲精品一部二部| 精品一区二区成人免费视频| 国产精品久久久久久麻豆一区软件| 亚洲美女搞黄| 99成人超碰| 永久免费网站视频在线观看| 欧美激情视频一区二区三区免费| 日本女人高潮视频| 欧美精品偷拍| 成年人网站国产| 美女91精品| 亚洲欧美激情网| 狠狠色综合色综合网络| 欧美一区二区三区影院| 成人午夜精品在线| 深爱五月激情网| 中文字幕免费观看一区| 免费精品在线视频| 一二三四区精品视频| 日韩精品成人在线| 在线免费观看不卡av| 国产裸体无遮挡| 日韩精品一区二区在线观看| 天天干,夜夜操| 在线中文字幕日韩| 国产激情在线| 欧美一级在线亚洲天堂| 成人精品动漫| 痴汉一区二区三区| 竹菊久久久久久久| 在线丝袜欧美日韩制服| 欧美精品97| 黑人糟蹋人妻hd中文字幕| 免费久久精品视频| 91传媒理伦片在线观看| 国产欧美一区二区精品性| 夫妻性生活毛片| 五月天一区二区| 一区二区三区亚洲视频| 精品免费国产二区三区| 国产福利片在线| 久久久久久国产精品三级玉女聊斋| 欧美羞羞视频| 成人高清在线观看| 精品国产精品久久一区免费式| 可以免费看的黄色网址| 免费在线欧美黄色| 老女人性生活视频| 国产亚洲一二三区| 久久久一二三区| 欧美综合一区二区| 日本高清视频在线| 久久久国产精品x99av| 精品91久久| 成人三级视频在线观看一区二区| 国内精品久久久久久久久电影网| 成人在线免费观看视频网站| 蜜桃视频一区二区三区在线观看| 免费a v网站| 亚洲免费在线看| 精品国产www| 日韩麻豆第一页| 黄网站在线观| 91精品视频专区| 波多野结衣一区| 亚洲熟女乱色一区二区三区| 国产成a人无v码亚洲福利| 女人裸体性做爰全过| 色婷婷亚洲精品| 天天操天天干天天干| 欧美人与性动交| 日韩黄色碟片| 日韩一本精品| 久久精品盗摄| 中文在线永久免费观看| 亚洲国产精品精华液网站| 国产精品一区二区av白丝下载| 亚洲天堂一区二区三区| 阿v视频在线| 国产精品乱子乱xxxx| 欧美日本中文| 制服下的诱惑暮生| 亚洲人成影院在线观看| 国产精品久久久久久久免费 | 激情五月综合色婷婷一区二区| 亚洲最大av| 一区二区三区国产好的精华液| 欧美国产一区视频在线观看| 无码视频在线观看| 亚洲欧美国产视频| 中文在线免费二区三区| 久久一区二区三区av| 国产日韩专区| 国产精品jizz| 91久久一区二区| 北条麻妃在线| 国产男女猛烈无遮挡91| 日韩欧美精品综合| 久久成年人网站| 亚洲人成小说网站色在线| 国产视频手机在线| 欧美精品在线第一页| 亚洲一区二区三区日本久久九| 色哟哟免费网站| 成人三级在线视频| 日本高清www免费视频| 亚洲免费精彩视频| 朝桐光一区二区| 日日噜噜噜噜夜夜爽亚洲精品| 日本亚洲天堂网| 特一级黄色录像| 精品99久久久久久| 波多野结衣亚洲| 一区二区免费电影| 国产福利精品导航| 日本黄色片视频| 国产亚洲激情在线| 日日夜夜综合| 国产91视频一区| 91天堂素人约啪| 中文字幕在线一| 欧美精品在线视频观看| 免费成人蒂法| 三级a在线观看| 一区二区三区在线视频观看58| 黑人精品一区二区三区| 日韩美女福利视频| 99久久久久| 欧美一区二区免费在线观看| 在线中文字幕一区| 成年人黄视频在线观看| 精品综合在线| 精品一二三四区| 国产成人一区二区三区影院在线| 亚洲人成啪啪网站| 国产精品久久久久久久久久辛辛 | 91视频免费在线看| 日韩精品免费在线播放| 日韩国产大片| 奇米精品一区二区三区| 1024成人网色www| 手机看片福利在线观看| 91精品综合久久久久久五月天| 亚洲高清在线| 香蕉久久久久久久| 亚洲福利视频免费观看| 免费成人黄色网| 日本午夜激情视频| 国产精品久久久久三级| 午夜激情在线视频| 92福利视频午夜1000合集在线观看| 中日韩视频在线观看| 欧美成人777|