Total Pageviews

Thursday, February 21, 2019

रूपविश्लेषक और रूपसर्जक (Morph Analyzer and Morph Generator)



रूपविश्लेषक और रूपसर्जक
(Morph Analyzer and Morph Generator)
मानव भाषाओं में शब्द के स्तर पर रूपिमिक दृष्टि से दो क्रियाएँ की जाती हैं- रूपविश्लेषण और रूपसर्जन। रूपविश्लेषण का संबंध किसी पद या शब्दरूप का विश्लेषण करते हुए मूल शब्द तथा रूपसाधक रूपिम या व्याकरणिक सूचनाएँ प्रदान करने से है।
रूपसर्जन का संबंध किसी मूल शब्द के सभी रूपों (पदों) का निर्माण करने से है।
रूपिमिक विश्लेषण और सर्जन की दृष्टि से किसी भाषा में प्राप्त होने वाले शब्दों के दो वर्ग किए जा सकते हैं-
(क) विकारी – वे शब्द जिनके शब्दरूप बनते हैं।
(ख) अविकारी – वे शब्द जिनके शब्दरूप नहीं बनते।
रूपविश्लेषण और रूपसर्जन का संबंध इनमें से विकारी शब्दों से है।
प्राकृतिक भाषा संसाधन के क्षेत्र में उक्त कार्यों को संपन्न करने वाली प्रणालियों को रूपविश्लेषक (Morph Analyzer) और रूपसर्जक (Morph Generator) कहते हैं। इन्हें संक्षेप में इस प्रकार देख सकते हैं-
(1) रूपविश्लेषक (Morph Analyzer)
रूपविश्लेषक वह प्रणाली है जो किसी पाठ में आए शब्दों (पदों) में लगे हुए मूल रूप (Stem) और संबंधतत्व- प्रत्यय (suffix) आदि को अलग करती है।
हिंदी में संज्ञासर्वनामविशेषणक्रिया शब्दवर्गों के शब्दों के रूप बनते हैं। अतः हिंदी रूपविश्लेषक इन शब्दों में आए हुए मूल शब्दों और उनके साथ जुड़ने वाले प्रत्ययों को अलग-अलग चिह्नित करता है। यदि शब्द अपने मूल रूप में ही वाक्य में आया हुआ हो तो रूपविश्लेषक द्वारा उसकी भी सूचना दी जाती है। रूपविश्लेषक द्वारा आउटपुट के रूप में चार प्रकार से सूचनाएँ दी जा सकती हैं-
·       शब्दरूप और मूलशब्द
·       शब्दरूप और मूलशब्द तथा व्याकरणिक सूचनाएँ
·       शब्दरूपमूलशब्द और प्रत्यय
·       शब्दरूपमूलशब्दप्रत्यय तथा व्याकरणिक सूचनाएँ
इसके लिए दो चीजों की आवश्यकता पड़ती है-
रूपविश्लेषण नियम + डाटाबेस
हिंदी में प्रयुक्त कुछ शब्दरूपों के विश्लेषण नियम इस प्रकार हैं-
1. संज्ञा शब्द
शब्दरूप इनपुट                          विश्लेषित आउटपुट
लड़का                                       लड़का (लड़का, Ø) : एकवचनपुल्लिंग
लड़के                                        लड़के (लड़का > े) : बहुवचनपुल्लिंग
लड़कों                                       लड़कों (लड़का) : बहुवचनपुल्लिंगपरसर्गीय
लड़की                                       लड़की (लड़की) : एकवचनस्त्रीलिंग
लड़कियाँ                                    लड़कियाँ (लड़की) : बहुवचनस्त्रीलिंग
लड़कियों                                    लड़कियों (लड़की) : बहुवचनस्त्रीलिंगपरसर्गीय
2. सर्वनाम शब्द
मैं                                  मैं (मैं, Ø) : उत्तमपुरुषएकवचन
मैंने                                मैंने (मैंने) : उत्तमपुरुषएकवचनपरसर्गीय
मुझको                           मुझको (मैं)>मुझको) : उत्तमपुरुषएकवचनपरसर्गीय

(2) रूपसर्जक (Morph Generator)
रूपसर्जक ऐसी प्रणाली हैजो किसी मूल शब्द का इनपुट देने पर उसके सभी रूप निर्मित कर दे। हिंदी में संज्ञासर्वनामविशेषणक्रिया शब्दवर्गों के शब्दों के रूप बनते हैं। इसके लिए दो चीजों की आवश्यकता पड़ती है-
रूपसर्जन नियम + डाटाबेस (मूल शब्द + प्रत्यय)
हिंदी के कुछ शब्दों के शब्दरूप निर्माण के उदाहरण इस प्रकार हैं-
1. संज्ञा शब्द
मूलशब्द इनपुट                         आउटपुट शब्दरूप
लड़का                                       लड़कालड़केलड़कों
लड़का : एकवचनपुल्लिंग
लड़के : एकवचनपरसर्गीय
लड़के : बहुवचनपुल्लिंग
लड़कों : बहुवचनपुल्लिंगपरसर्गीय



Wednesday, February 20, 2019

खंडीकरण


खंडीकरण (Segmentation)
किसी बड़ी भाषिक इकाई का इनपुट प्राप्त होने पर उसे छोटी इकाइयों में खंडित करने की प्रक्रिया खंडीकरण है। पाठ संबंधी अनुप्रयोगों में सामान्यतः पाठ का ही इनपुट प्राप्त होता है। एक पाठ के निम्नलिखित खंड किए जा सकते हैं-
इस प्रकार का खंडीकरण किसी प्रोग्रामिंग भाषा में स्ट्रिंग मैनीपुलेशन संबंधी निर्देशों के माध्यम से किया जा सकता है, क्योंकि टंकित पाठ में मशीन इन्हें अलग-अलग पहचान सकती है। इनके अलावा अन्य खंड, जैसे- उपवाक्य, पदबंध, रूपिम (मुक्त और बद्ध) भाषायी नियमों के माध्यम से प्राप्त किए जाते हैं।



मशीनी अनुवाद प्रणालियाँ





Monday, February 18, 2019

वर्तनी जाँचक : सुझाव प्रस्तुति


वर्तनी जाँचक : सुझाव प्रस्तुति
किसी भाषा के लेखन या टंकण में होने वाली वर्तनी संबंधी त्रुटियों का परीक्षण करने वाली प्रणाली वर्तनी जाँचक है। वर्तनी की त्रुटि शब्द और शब्दरूप (पद) के सही लेखन या टंकण से संबंधित है।
वर्तनी जाँचक में त्रुटिपूर्ण शब्दों की पहचान करना अपेक्षाकृत सरल कार्य है। यदि प्रणाली डाटाबेस आधारित है तो संबंधित भाषा के शब्द डाटाबेस में संग्रहीत कर दिए जाते हैं और यदि पाठ का इनपुट मिलने पर उसके सभी शब्दों का डाटाबेस के शब्दों से मिलान किया जाता है और जो शब्द नहीं प्राप्त होते हैं उन्हें त्रुटिपूर्ण शब्द के रूप में प्रदर्शित किया जाता है।
सुझाव प्रस्तुति अपेक्षाकृत एक कठिन प्रक्रिया है। इसके लिए सर्वप्रथम यह ज्ञात करना होता है कि लेखन या टंकण कर रहे व्यक्ति से किस प्रकार की त्रुटियाँ हो सकती हैं। सामान्यतः चार प्रकार की त्रुटियों की संभावना रहती है-
(1)  क्रम परिवर्तन
लेखन या टंकण कर रहा व्यक्ति जल्दीबाजी में शब्द के अंदर वर्णों का क्रम बदल देता है और गलत शब्द टंकित कर देता है, जैसे-
चलना =  लचना
कटहल = कहटल
(2)  वर्ण-परिवर्तन
जब एक वर्ण की जगह कोई दूसरा वर्ण टंकित हो जाए और शब्द गलत हो जाए, जैसे-
(क) स्वर परिवर्तन-
कीटनाशक = किटनाशक
कुलदेवता = कूलदेवता
(ख) व्यंजन परिवर्तन
फसल = पसल
घर = गर
(3)  वर्णलोप- जब कोई वर्ण छूट जाए, जैसे-
(क) स्वर लोप-
कीटनाशक = कटनाशक
कुलदेवता = कुलदवता
(ख) व्यंजन लोप-
सामाजीकरण = सामाजीकण
भारतीय = भातीय
(4)  वर्णागम- किसी अनावश्यक वर्ण टंकित हो जाना, जैसे-
भारतीय = भारातीय
भारतीय = भारतीया
अतः वर्तनी जाँचक का निर्माण करते समय इन सभी प्रकार की संभावित त्रुटियों के आधार पर सुझाव प्रस्तुत करने के नियम दिए जाने चाहिए।