टेक्स्ट में छिपे कैरेक्टर
छिपे कैरेक्टर ऐसे Unicode कोड पॉइंट हैं जो दिखते नहीं पर टेक्स्ट में सचमुच मौजूद होते हैं: ज़ीरो-विड्थ स्पेस, दिशा-नियंत्रण कैरेक्टर, असामान्य स्पेस और कंट्रोल कैरेक्टर। ये स्ट्रिंग तुलना, खोज और डेटा इंपोर्ट तोड़ते हैं, और कोड में स्क्रीन पर दिखने और चलने के क्रम को अलग कर सकते हैं।
और देखें: क्या मिला, एक्स-रे व्यू और विकल्प
एक्स-रे व्यू
आपका टेक्स्ट, जिसमें हर छिपा कैरेक्टर लेबल के रूप में दिखता है। Unicode नाम देखने के लिए होवर करें।
क्या मिला
| कोड पॉइंट | कैरेक्टर | संख्या | कार्रवाई |
|---|
मुख्य श्रेणियाँ
- ज़ीरो-विड्थ (U+200B, U+200C, U+2060…): बिना चौड़ाई के, ये शब्दों को खोज और regex के लिए अदृश्य रूप से तोड़ देते हैं।
- दिशा-नियंत्रण कैरेक्टर (U+202A–U+202E, U+2066–U+2069): स्टोर हुए टेक्स्ट को बदले बिना दिखने का क्रम बदल देते हैं। कोड में सबसे जोखिम भरी श्रेणी।
- असामान्य स्पेस (U+00A0, U+202F, U+3000…): सामान्य स्पेस जैसे दिखते हैं पर दूसरे कैरेक्टर हैं, और CSV कॉलम व इंडेंटेशन तोड़ते हैं।
- कंट्रोल कैरेक्टर (C0/C1 ब्लॉक): बाइनरी डेटा या गलत डिकोडिंग के अवशेष, जो CSV, TSV और लॉग बिगाड़ते हैं।
ये आते कहाँ से हैं
ये लगभग कभी जान-बूझकर डाले गए मार्क नहीं होते। ये कॉपी के रास्ते में जुड़ते हैं: CMS एडिटर, PDF एक्सपोर्ट, वर्ड प्रोसेसर, अच्छी टाइपोग्राफ़ी वाले वेब पेज और स्प्रेडशीट। AI टेक्स्ट इन्हें चैट इंटरफ़ेस से उठाता है, मॉडल से नहीं।
टेक्स्ट को नुकसान पहुँचाए बिना इन्हें कैसे हटाएँ
ऊपर का टूल टेक्स्ट को कोड पॉइंट दर कोड पॉइंट पढ़ता है: अदृश्य को हटाता है, असामान्य स्पेस को सामान्य स्पेस से बदलता है (कभी मिटाता नहीं, ताकि शब्द आपस में न चिपकें) और इमोजी तथा फ़ारसी, कोरियाई, खमेर और ब्रेल लिपियाँ सुरक्षित रखता है। सफ़ाई से पहले हर कैरेक्टर एक्स-रे व्यू में दिखता है।
अक्सर पूछे जाने वाले सवाल
क्या छिपे कैरेक्टरों का न होना साबित करता है कि टेक्स्ट AI का नहीं?
नहीं, और उलटा भी उतना ही गलत है। छिपे कैरेक्टर कॉपी का रास्ता बताते हैं, लेखक किसी भी दिशा में नहीं।
ये कोड में खतरनाक क्यों हैं?
एक दिशा-नियंत्रण कैरेक्टर से कोई कमेंट वहाँ खत्म होता दिख सकता है जहाँ वह खत्म नहीं होता, जबकि कंपाइलर आपसे कुछ अलग देखता है।