टेक्स्ट सांख्यिकी

रिक्त स्थान सहित और बिना, शब्दों, अनूठे शब्दों, वाक्यों, पैराग्राफ़ों और पंक्तियों की गणना करें। अनुमानित पठन समय और शब्द आवृत्ति, आपके ब्राउज़र में लाइव गणना की गई।

एक टेक्स्ट ब्लॉक से ज़रूरत के हर गणना, टाइप करते ही लाइव। वर्ण, शब्द, अनूठे शब्द, वाक्य, पैराग्राफ़, पंक्तियाँ और अनुमानित पठन समय पाने के लिए टेक्स्ट पेस्ट या टाइप करें। आवृत्ति सूची दिखाती है कि वास्तव में कौन से शब्द टुकड़े को धारण करते हैं, और आप मायने रखने वाले शब्दों को देखने के लिए सामान्य भराव शब्दों को छिपा सकते हैं।

वर्ण
0
वर्ण (बिना रिक्त स्थान)
0
शब्द
0
अनूठे शब्द
0
वाक्य
0
पैराग्राफ़
0
पंक्तियाँ
0
पठन समय
0
सबसे बार आने वाले शब्द

टेक्स्ट गिनना दिखने से कम स्पष्ट है

शब्द ठीक है क्या

तीन प्रोग्रामों से शब्द गणना माँगें और आप आसानी से तीन उत्तर पा सकते हैं। असहमति कोई बग नहीं है, यह एक परिभाषा समस्या है। "state-of-the-art" जैसा हाइफ़नयुक्त संयुक्त शब्द एक टाइपसेटर के लिए एक शब्द और एक नाइव विभाजक के लिए चार है। "don't" में एपॉस्ट्रॉफ को शब्द को विभाजित नहीं करना चाहिए, जबकि उद्धरण चिह्न के रूप में उपयोग किए गए एपॉस्ट्रॉफ को करना चाहिए। संख्याएँ, URL और ईमेल पते प्रत्येक एक अलग नियम आमंत्रित करते हैं।

यह उपकरण शब्द को अक्षरों या अंकों की एक श्रृंखला मानता है, जिसे वैकल्पिक रूप से एक एपॉस्ट्रॉफ और अधिक अक्षरों द्वारा जारी किया जा सकता है। चूँकि मिलान Unicode-जागरूक है, इसलिए उच्चारण-चिह्नित लातिनी, यूनानी, सिरिलिक और CJK वर्ण सभी अक्षर के रूप में गिने जाते हैं न कि चुपचाप छोड़े जाते हैं। श्रृंखलाओं के बीच विराम चिह्न उन्हें अलग करते हैं, इसलिए "well-known" दो गिना जाता है और "it's" एक। नियम जानना इससे अधिक मायने रखता है कि कौन सा नियम चुना गया है, क्योंकि यह आपको संख्या का अनुमान लगाने देता है न कि इस पर बहस करने के लिए।

वाक्य, पैराग्राफ़ और पंक्तियाँ

भाषा मॉडल के बिना वाक्य का पता लगाना स्वभाव से अनुमानित है। पूर्ण विराम, प्रश्न चिह्न और विस्मयादिबोधक चिह्न पर विभाजन साधारण गद्य के लिए काम करता है और संक्षिप्त रूपों पर भविष्यवाणीपूर्वक विफल होता है: "Dr. Smith arrived at 9 a.m." एक नाइव विभाजक के लिए तीन वाक्य जैसा दिखता है। वाक्य गणना को पठनीयता कार्य के लिए एक अच्छा अनुमान मानें, न कि एक सटीक आँकड़े के रूप में।

पैराग्राफ़ और पंक्तियाँ अधिक यांत्रिक हैं लेकिन फिर भी भिन्न हैं। एक पंक्ति कुछ भी है जो न्यूलाइन से अलग हो, इसलिए हार्ड-रैप्ड फ़ाइल में कई पंक्तियाँ और कम पैराग्राफ़ होते हैं। एक पैराग्राफ़ एक या अधिक रिक्त पंक्तियों से अलग किया गया ब्लॉक है, जो इस बात से मेल खाता है कि Markdown और अधिकांश संपादक कैसे सोचते हैं। दो संख्याओं की तुलना करने से जल्दी पता चल जाता है कि क्या टेक्स्ट हार्ड-रैप्ड आया था, जो तब मायने रखता है जब किसी ऐसे सिस्टम में पेस्ट किया जा रहा हो जो पुनःप्रवाहित करता है।

पठन समय और आवृत्ति

पठन-समय अनुमान 200 शब्द प्रति मिनट का उपयोग करता है, साधारण गद्य की मूक पठन के लिए एक सामान्य औसत। वास्तविक गति व्यापक रूप से भिन्न होती है: कोड नमूनों वाली तकनीकी सामग्री धीमी चलती है, परिचित मार्केटिंग कॉपी तेज़, और फ़ोन पर पढ़ना डेस्कटॉप की तुलना में धीमा है। आँकड़े को तुलनात्मक तुलना के लिए उपयोग करें, अपने पाठकों से वादा के रूप में नहीं।

शब्द आवृत्ति वह जगह है जहाँ उपकरण संपादन में अपना स्थान कमाता है। गणना से क्रमबद्ध करने पर अचेतन पुनरावृत्ति, वे क्रूर शब्द जो आठ सौ में ग्यारह बार आते हैं, और यह कि जिस विषय के बारे में आप लिखना चाहते थे वह वास्तव में सबसे बार आने वाला संज्ञा है या नहीं, प्रकट होता है। "सामान्य शब्दों को नज़रअंदाज़ करें" टॉगल बंद-वर्ग कार्य शब्दों जैसे लेख, पूर्वसर्ग और सर्वनाम को हटा देता है, जो अन्यथा हर भाषा में हर सूची पर हावी रहते हैं और कुछ नहीं बताते।

ओपन-सोर्स नोट: किसी तृतीय-पक्ष लाइब्रेरी के बिना शुद्ध JavaScript में लागू किया गया।

FAQ

मेरी शब्द गणना मेरे वर्ड प्रोसेसर से अलग क्यों है?
अलग-अलग उपकरण शब्दों को अलग-अलग परिभाषित करते हैं, खासकर हाइफ़न, एपॉस्ट्रॉफ और संख्याओं के आसपास। यह उपकरण अक्षरों या अंकों की श्रृंखला गिनता है, इसलिए "well-known" दो शब्द हैं और "it's" एक।
दो वर्ण गणनाओं के बीच क्या अंतर है?
पहली गिनती हर वर्ण को रिक्त स्थान, टैब और न्यूलाइन सहित गिनती है। दूसरी सभी whitespace को हटा देती है, जो वह आँकड़ा है जिसे अधिकांश वर्ण सीमाएँ वास्तव में मानती हैं।
पठन समय की गणना कैसे की जाती है?
शब्दों को 200 प्रति मिनट से विभाजित किया जाता है, साधारण गद्य के लिए मूक-पठन का एक विशिष्ट औसत। कोड वाला तकनीकी टेक्स्ट धीमा है, इसलिए इसे तुलनात्मक आँकड़े के रूप में लें।
वाक्यों का पता कैसे लगाया जाता है?
पूर्ण विराम, प्रश्न चिह्न और विस्मयादिबोधक चिह्न पर विभाजन करके। "a.m." जैसे संक्षिप्त रूप गणना को बढ़ा सकते हैं, इसलिए यह एक अनुमान है न कि सटीक संख्या।
सामान्य शब्दों को नज़रअंदाज़ करने वाला "Ignore common words" विकल्प क्या हटाता है?
कार्य शब्द जैसे the, and, of, to और सामान्य सर्वनाम। वे हर आवृत्ति सूची के शीर्ष पर होते हैं और विषय के बारे में कुछ नहीं बताते, इसलिए उन्हें छिपाने से सार्थक शब्द सामने आते हैं।
क्या मेरा टेक्स्ट कहीं अपलोड किया जाता है?
नहीं। सारी गणना JavaScript के साथ आपके ब्राउज़र में होती है। सर्वर पर कुछ नहीं भेजा जाता, यही कारण है कि संख्याएँ टाइप करते ही तुरंत अपडेट होती हैं।