محول النص إلى يونيكود

حوّل النص إلى نقاط رموز يونيكود أو كيانات HTML أو تسلسلات هروب جافاسكربت، وفك ترميزها عائدًا. دعم كامل للمستوى النجمي والرموز التعبيرية.

حوّل النص إلى نقاط رموز يونيكود والعودة. اختر كيانات HTML أو هروبات جافاسكربت أو تدوين U+. كلا اللوحتين قابلتان للتحرير، والأحرف خارج مستوى اللغات الأساسي — بما في ذلك كل الرموز التعبيرية — تُعامل كنقاط رموز مفردة بدلًا من أزواج بديلة.

نقاط الرموز والترميزات والأزواج البديلة

نقطة الرمز ليست بايتًا

يخصص يونيكود لكل حرف رقمًا يسمى نقطة رمز، يُكتب U+ متبوعًا بأرقام سداسية عشرية. A هي U+0041، و هي U+8702، والرمز التعبيري للنحلة هو U+1F41D. ذلك الرقم هو هوية الحرف. كيف يُخزَّن — UTF-8 أو UTF-16 أو UTF-32 — قرار منفصل، ولهذا تختلف هذه الأداة عن محول النص-إلى-ثنائي.

فخ الزوج البديل

سلاسل جافاسكربت بصيغة UTF-16. تُخزَّن نقاط الرموز فوق U+FFFF كنصفيّ 16-بت يُسميان زوجًا بديلًا. الكود الساذج الذي يتكرر بـ charCodeAt يرى الرمز التعبيري كقيمتين بلا معنى حول 0xD800-0xDFFF ويبلغ عن "🐝".length كأنها 2. يتكرر هذا المحول بنقطة الرمز، لذا ينتج رمز النحلة قيمة واحدة، U+1F41D، وليس نصفيّ مكسورين.

تنسيقات الإخراج الأربعة

  • كيان HTML عشريA. يعمل في أي مستند HTML وفي XML.
  • كيان HTML سداسي عشريA. نفس الشيء بنظام سداسي عشري، وهو ما يطابق طريقة كتابة مخططات يونيكود.
  • هروب جافاسكربت\u0041. للثوابت النصية في الكود المصدري. فوق U+FFFF الصيغة المعقوفة \u{1F41D} مطلوبة، وتصدرها الأداة تلقائيًا.
  • تدوين نقطة الرمزU+0041. الصيغة المستخدمة في المواصفات والتوثيق.

استخدامات عملية

تهريب النص غير-ASCII ككيانات يجعله ينجو من الأنظمة التي تفسد الترميزات، مثل بوابات البريد القديمة أو قواعد البيانات المضبوطة خطأً. فحص نقاط الرموز هو أيضًا أسرع طريقة لتشخيص الأحرف غير المرئية: المسافة ذات العرض الصفري (U+200B) أو المسافة غير المنكسرة (U+00A0) تبدو مطابقة للمسافة العادية على الشاشة لكنها تكسر مقارنات السلاسل. الصق النص المشبوه هنا وسيصبح الفرق مرئيًا فورًا.

إشعار مفتوح المصدر: منفّذ باستخدام String.prototype.codePointAt وString.fromCodePoint الأصليين في جافاسكربت. لا تُستخدم أي مكتبة خارجية.

الأسئلة الشائعة

لماذا ينتج رمز تعبيري واحد U+1F41D مفردة بدلًا من قيمتين؟
تتكرر الأداة بنقطة الرمز بدلًا من وحدة UTF-16. الرموز التعبيرية تعيش فوق U+FFFF، لذا تقسمها حلقات الأحرف الساذجة إلى أزواج بديلة؛ هذه الأداة لا تفعل ذلك.
ما الفرق بين هذه الأداة وأداة النص-إلى-ثنائي؟
تعرض هذه الأداة نقاط الرموز، الهوية المجردة لكل حرف. تعرض أداة الثنائي بايتات UTF-8 المستخدمة لتخزينها. حرف واحد يمكن أن يكون نقطة رمز واحدة لكن ثلاثة بايتات.
هل يمكنني فك ترميز خليط من التنسيقات؟
نعم. يتعرف المفكك على &#..; و&#x..; و\uXXXX و\u{...} وU+.... في نفس الإدخال، وأي نص بين الهروبات يُحفظ كما هو.
كيف أجد الأحرف غير المرئية في سلسلة؟
الصقها وبدّل إلى تدوين U+. تظهر المسافات ذات العرض الصفري كـ U+200B، والمسافات غير المنكسرة كـ U+00A0، وعلامات ترتيب البايت كـ U+FEFF — كلها غير مرئية على الشاشة لكنها واضحة هنا.
هل كيانات HTML آمنة لوضعها مباشرة في صفحة؟
نعم، مراجع الأحرف الرقمية صالحة في HTML وXML. لاحظ أنها تهرب الأحرف نفسها فقط؛ وليست بديلًا عن تهريب HTML الصحيح لـ < و> و& في المحتوى غير الموثوق.
هل يغادر شيء متصفحي؟
لا. التحويل معالجة سلاسل خالصة تُنفذ محليًا.