テキスト→Unicode変換
テキストを Unicode コードポイント・HTML エンティティ・JavaScript エスケープへ変換し、逆変換も可能。追加面の文字や絵文字にも完全対応。
テキストと Unicode コードポイントを相互変換します。 HTML エンティティ、JavaScript エスケープ、U+ 表記から選べます。両方のパネルが編集可能で、基本多言語面の外にある文字(すべての絵文字を含む)はサロゲートペアではなく単一のコードポイントとして扱われます。
テキストを Unicode コードポイント・HTML エンティティ・JavaScript エスケープへ変換し、逆変換も可能。追加面の文字や絵文字にも完全対応。
テキストと Unicode コードポイントを相互変換します。 HTML エンティティ、JavaScript エスケープ、U+ 表記から選べます。両方のパネルが編集可能で、基本多言語面の外にある文字(すべての絵文字を含む)はサロゲートペアではなく単一のコードポイントとして扱われます。
Unicode はすべての文字にコードポイントと呼ばれる番号を割り当て、U+ に続けて16進数で表記します。A は U+0041、蜂 は U+8702、ミツバチの絵文字は U+1F41D です。この番号が文字の identity です。どう保存するか(UTF-8、UTF-16、UTF-32)は別の判断であり、本ツールが「テキスト→2進数」と異なるのはこの点です。
JavaScript の文字列は UTF-16 です。U+FFFF を超えるコードポイントは、サロゲートペアと呼ばれる 16 ビット 2 つに分けて格納されます。charCodeAt で素朴にループするコードは、絵文字を 0xD800〜0xDFFF の意味のない 2 値として認識し、"🐝".length を 2 と報告します。本ツールはコードポイント単位で反復するため、ミツバチの絵文字は U+1F41D という 1 つの値になります。
A。あらゆる HTML 文書と XML で機能します。A。同じ内容を16進で表したもので、Unicode の一覧表の表記に合わせた形式です。\u0041。ソースコード中の文字列リテラル向け。U+FFFF を超える場合は波括弧形式 \u{1F41D} が必要で、本ツールは自動で出力します。U+0041。仕様書やドキュメントで使われる形式です。非 ASCII テキストをエンティティに変換しておくと、古いメールゲートウェイや設定の誤ったデータベースなど、文字コードを壊すシステムを通しても内容が保たれます。コードポイントの確認は、不可視文字を突き止める最速の方法でもあります。ゼロ幅スペース(U+200B)やノーブレークスペース(U+00A0)は画面上では通常の空白と区別できませんが、文字列比較を失敗させます。疑わしいテキストを貼り付ければ違いがすぐ分かります。