PDF থেকে Word: কখন লেখা তুলবেন আর কখন OCR করবেন
পড়ার ধরন বাছুন, সোর্স যাচাই করুন ও ছবির শব্দ বাদ না দিয়ে PDF লেখা সম্পাদনাযোগ্য অনুচ্ছেদে বদলান।
ToolMellow ·
একটি বাক্য নির্বাচন করে দেখুন
PDF-এ লেখা, লেখার ছবি বা দুটোই থাকতে পারে। বিদ্যমান লেখা প্রায়ই অপটিক্যাল ক্যারেক্টার রিকগনিশন ছাড়াই পড়া যায়। স্ক্যান পাতার ছবির অক্ষর চিনতে সাধারণত OCR দরকার। লেখা নির্বাচন করতে পারা ভালো প্রাথমিক পরীক্ষা, কিন্তু শিরোনাম নির্বাচনযোগ্য হলেই বাকি পাতায় টেক্সট স্তর আছে এমন নয়।
পাতার বিষয়বস্তু অনুযায়ী পড়ার ধরন বাছুন
ToolMellow-এর স্বয়ংক্রিয় ধরন বিদ্যমান টেক্সট স্তর পড়ে এবং কেবল লেখা না পাওয়া পাতায় নির্বাচিত OCR ভাষা ব্যবহার করে। আলাদা মূল-লেখার পাতা ও স্ক্যান পাতা থাকা নথিতে এটি কাজে লাগে। একই পাতায় নির্বাচনযোগ্য শিরোনাম ও স্ক্যান করা চালান থাকলে সব নির্বাচিত পাতার জন্য OCR বাছুন, যাতে ছবির শব্দও পড়া হয়। সোর্স পরিষ্কার দেখালেও OCR ভুল করতে পারে।
মুদ্রিত লেখার ভাষা বাছুন
স্ক্যান পড়ার আগে ইংরেজি, সরলীকৃত চীনা, হিন্দি, স্প্যানিশ, ফরাসি, আরবি, বাংলা, জার্মান, ইতালীয় বা পর্তুগিজ বাছুন। এক কাজে একটি ভাষা প্রযোজ্য। নথির ভাষা বদলালে আলাদা পৃষ্ঠা-সীমা পড়ুন; ভাষা শনাক্তকরণ বা অনুবাদ নেই। OCR লাগলেই শুধু নির্বাচিত মডেল ডাউনলোড হয়। বিদ্যমান PDF লেখা পড়তে OCR ডাউনলোড লাগে না। ভাষা বদলালে আগের পর্যালোচনা ও ডাউনলোড মুছে যায়, যাতে পুরোনো ফলকে নতুন মনে না হয়।
রপ্তানির আগে মিলিয়ে দেখুন
পর্যালোচনায় মূল পাতা এবং সম্পাদনাযোগ্য লেখা বা পুনর্গঠিত ব্লক দেখা যায়। নাম, তারিখ, টাকার অঙ্ক, অ্যাকাউন্ট নম্বর, যতিচিহ্ন, টেবিলের ঘর ও পড়ার ক্রম যাচাই করুন। লেখা তোলার সময় ফর্মের মান বাদ যেতে পারে বা অপ্রত্যাশিত ক্রম হতে পারে। OCR-এর আস্থার মান ইঞ্জিনের অনুমান, কোনো সংখ্যা সঠিক হওয়ার নিশ্চয়তা নয়। Word তৈরির আগে নির্বাচিত সংস্করণ সংশোধন করুন; সাধারণ লেখা ও কাঠামোর সম্পাদনা আলাদা থাকে।
সাধারণ অনুচ্ছেদ বা যাচাই করা কাঠামো বাছুন
পড়ার আগে নথির কাঠামো পুনর্গঠন চালু করলে অনুচ্ছেদ, ট্যাগযুক্ত শিরোনাম ও সরল তালিকা, এক বা দুই কলামের অংশ, ট্যাগযুক্ত বা সহজভাবে সারিবদ্ধ টেবিল, মৌলিক শৈলী ও সমর্থিত ছবির ক্রপ শনাক্ত হয়। শিরোনামের স্তর, তালিকার শৈলী, ভেতরের স্তর ও নম্বর দেখুন। নিজস্ব লেবেল লেখা হিসেবেই থাকে; সোর্স পাতা পেরোনো তালিকা দৃশ্যমান শুরুর নম্বর রেখে আলাদা Word তালিকা হয়। ঘর সম্পাদনা করুন, ব্লক সাজান, কলামের মধ্যে সরান ও বাদ পড়া ছবি পাতা থেকে কাটুন। এতে সমর্থিত ফন্ট-পরিবারের নাম ও একরঙা লেখাসহ আসল সম্পাদনাযোগ্য Word বিষয়বস্তু তৈরি হয়; অনুচ্ছেদ ও ঘরের মিশ্র শৈলীও থাকে। লেখা বদলালে বদলানো অংশের বাইরের শৈলী বজায় থাকে। ফন্ট, রং ও হাতে আন্ডারলাইন করার নিয়ন্ত্রণ দেখুন; ফন্ট এম্বেড হয় না বলে না থাকা ফন্ট প্রতিস্থাপিত হয়। স্বচ্ছতা, নকশা, নির্ভরযোগ্যভাবে মেলানো যায় না এমন আঁকা লেখা, নিখুঁত অবস্থান, লিংক ও ইন্টারঅ্যাকটিভ ফর্ম থাকে না। মূল পাতার মাপ, Letter ও A4 আছে; লেখা তবুও বেশি পাতায় ছড়াতে পারে। হুবহু চেহারা দরকার হলে PDF রাখুন।
সামলানো যায় এমন পৃষ্ঠা-সীমায় কাজ করুন
সর্বোচ্চ 50 MB PDF থেকে 50টি মূল পাতা বাছুন, যার মধ্যে সর্বোচ্চ 10টি OCR পাতা। 2-4, 7-এর মতো সীমা কাজ কমায় ও মনোযোগ দিয়ে যাচাইয়ে সাহায্য করে। OCR মুদ্রিত ইংরেজি, সরলীকৃত চীনা, হিন্দি, স্প্যানিশ, ফরাসি, আরবি, বাংলা, জার্মান, ইতালীয় বা পর্তুগিজের জন্য; কাঠামোর ধরনে সোজা স্ক্যান দরকার, কারণ শনাক্ত শব্দের অবস্থান ব্যবহার হয়। ঝাপসা স্ক্যান, হাতের লেখা, জটিল বিন্যাস ও অন্য ভাষার জন্য অন্য প্রক্রিয়া দরকার। স্থানীয় রেন্ডারিং বা সময়সীমা পেরোলে টুল কাজ থামায়।
যাচাই করা লেখা গুনুন
যাচাই করা লেখা গুনুন, শব্দ গণনাকারীতে সেই বিষয়বস্তু খোলে যা যাচাই করা লেখা ডাউনলোড করুন দেয়, আপনার নির্বাচিত মূল পাতার ক্রমে। এটি বাছা সাধারণ লেখা বা কাঠামোর সংস্করণ নেয়, টেবিলের ঘর ও তালিকার লেখার বদলসহ। ছবি শব্দে পরিণত হয় না। স্থানান্তর একবারের এবং ট্যাবের মেমোরিতে থাকে; লেখা URL বা ব্রাউজার স্টোরেজে যায় না। গণনাকারী পাতার বিভাজকসহ দশ লক্ষ অক্ষর নেয়; বড় লেখা ডাউনলোডে পাওয়া যায়। গণনাকারীতে মুছুন দিলে পাঠানো লেখা ও তার পূর্বাবস্থায় ফেরার ইতিহাস মুছে যায়।
বন্ধ করার আগে ফলাফল রাখুন
PDF, পাসওয়ার্ড, পর্যালোচনার বদল ও ফলাফল ট্যাবের মেমোরিতে থাকে। শনাক্তকরণ ইঞ্জিন ও নির্বাচিত ভাষার মডেল প্রয়োজন হলে ToolMellow থেকে লোড হয়; নথি আপলোড হয় না। রিফ্রেশ বা চলে যাওয়ার আগে DOCX ডাউনলোড করুন, তারপর ওয়ার্ড প্রসেসরে খুলে আবার যাচাই করুন।