Unicode 字符编码查询

字符与码点互查:UTF-8/UTF-16/HTML 实体/URL 编码一次给全,附常用区块浏览。

排查一个「乱码」问题时,你需要的是这个字符的完整编码档案:它的码点是 U+4E2D 还是 U+1F600、UTF-8 编成几个字节、UTF-16 是不是代理对、HTML 里该写什么实体、URL 里会变成什么。本工具输入字符(或反向输入码点)即给出全部七种表示,一次看全。

另一个高频需求是「找一个特殊字符」:箭头、数学符号、制表符、Emoji——按区块浏览比翻输入法快。工具内置十二个常用区块(Latin-1、箭头、数学运算符、制表符、Emoji、CJK 常用字等),点击任意字符即填入查询框显示细节。

UTF-8 与 UTF-16:两套编码同一套字符

UTF-8 是变长 1-4 字节,ASCII 部分单字节、汉字三字节、Emoji 四字节,是互联网与文件的默认编码;UTF-16 用 2 或 4 字节(BMP 内 2 字节),是 JavaScript 字符串与 Windows API 的内部形态。码点超过 BMP(U+FFFF)的字符——最常见的就是 Emoji——在 UTF-16 里占两个代理对码元,这正是 string.length 对 Emoji 返回 2 的原因。

同一字符的七种写法

HTML 实体 😀 用于源码里不想直接放字符的场景;URL 编码 %F0%9F%98%80 出现在链接与日志里;JS 转义 \u{1F600} 在代码里表达字符。排查「日志里的 %F0%9F 是什么」时,把编码片段粘进来即可还原成字符再看。

常见问题

能查字符的官方名称吗?
暂不支持(Unicode 名称数据库体积较大,不适合浏览器工具的加载模型)。码点确定后, combin 该码点在 unicode.org 或任意字符百科站点即可查到正式名称。
为什么有些区块的字符显示为方框?
那是你的系统字体缺字形,不是数据问题——编码是存在的,只是渲染不出来。字体覆盖随操作系统与安装的字体而变。
和 JSON Unicode 转义工具的区别?
本页面向「一个字符的完整编码档案」;站内 JSON 工具族的 Unicode 页面向「整段文本与 \uXXXX 转义的批量互转」。两页互链。

相关工具