দৃশ্যটা সাধারণ: আপনার একটা চুক্তি, পুরোনো খসড়া বা প্রাতিষ্ঠানিক নথি এডিট করা দরকার, কিন্তু যে ফাইলটা আছে তা শুধু PDF — মূল .docx হারিয়ে গেছে, অন্য কোনো কম্পিউটারে থেকে গেছে, অথবা কখনোই ছিল না (নথিটা অন্য কারও বা অন্য প্রতিষ্ঠানের কাছ থেকে তৈরি হয়ে এসেছে)। পৃষ্ঠার পর পৃষ্ঠা আবার টাইপ করা শেষ বিকল্প; PDF থেকে সরাসরি একটা এডিটযোগ্য ফরম্যাটে টেক্সট বের করা বেশিরভাগ ক্ষেত্রে সমাধান করে দেয়।
এই এক্সট্র্যাকশন কারিগরিভাবে কী করে
টেক্সট এক্সট্র্যাকশন PDF-এর ভেতরে ইতিমধ্যে থাকা টেক্সট স্তর পড়ে — একই টেক্সট যা আপনি PDF রিডারে ফাইলটা খুলে মাউস দিয়ে নির্বাচন ও কপি করতে পারেন — এবং সেটাকে একটা Word (.docx) নথি বা সাধারণ টেক্সট (.txt) ফাইলে পুনর্গঠিত করে, এডিট করার জন্য প্রস্তুত।
এটা কাজ করে কারণ একটা "স্বাভাবিকভাবে জন্ম নেওয়া" PDF (Word, একটা ওয়েবসাইট বা যেকোনো এডিটর থেকে তৈরি — স্ক্যান করা না) টেক্সটকে টেক্সট হিসেবে সংরক্ষণ করে, ছবি হিসেবে না। প্রতিটা অক্ষরের ফাইলের ভেতরে একটা জানা অবস্থান ও মান আছে, যা টেক্সট কন্টেন্ট বিশ্বস্তভাবে পুনর্গঠন করতে দেয়।
এক্সট্র্যাকশন কী সংরক্ষণ করে — আর কী করে না
✅ সম্পূর্ণ টেক্সট কন্টেন্ট, পৃষ্ঠায় যে ক্রমে আছে ঠিক সেই ক্রমে।
✅ পৃষ্ঠা বিরতি, নথির মূল বিভাজন বজায় রেখে।
⚠️ উন্নত ভিজ্যুয়াল ফরম্যাটিং স্বয়ংক্রিয়ভাবে পুনর্গঠিত হয় না — বোল্ড, ইটালিক, ফন্ট সাইজ, রং, জটিল টেবিল এবং মূল PDF-এর একাধিক কলাম তৈরি করা Word-এ এডিটযোগ্য ফরম্যাটিং হিসেবে পুনরায় তৈরি হয় না; ফলাফল সাধারণ ফরম্যাটিংয়ের টেক্সট, যেখানে আপনি প্রয়োজনীয় ফরম্যাটিং আবার প্রয়োগ করতে পারবেন।
⚠️ ছবি টেক্সটের সাথে বের হয় না — নথিতে লোগো, স্ক্যান করা স্বাক্ষর বা এমবেড করা ছবি থাকলে, সেগুলো আলাদাভাবে সামলাতে হবে (যেমন, প্রয়োজনে পুরো পৃষ্ঠাটা ছবি হিসেবে বের করতে PDF থেকে ছবি কনভার্টার দিয়ে)।
❌ স্ক্যান করা PDF (ছবি, টেক্সট স্তর ছাড়া) এভাবে বের করা যায় না। একটা স্ক্যান করা নথি — কাগজের একটা ডিজিটাইজেশন, একটা পুরোনো চুক্তির ছবি — কারিগরিভাবে PDF-এর ভেতরে একটা ছবি, পেছনে কোনো নির্বাচনযোগ্য টেক্সট ছাড়াই। এই ধরনের ফাইল থেকে টেক্সট বের করতে OCR (অপটিক্যাল ক্যারেক্টার রিকগনিশন) লাগবে, একটা আলাদা প্রক্রিয়া যা এই টুল করে না। এক্সট্র্যাকশন ব্যবহারের আগে পরীক্ষা করুন: একটা সাধারণ রিডারে মাউস দিয়ে PDF-এর টেক্সট নির্বাচন ও কপি করতে পারলে, এক্সট্র্যাকশন কাজ করবে; "টেক্সট" আসলে নথির একটা ছবি হলে, কাজ করবে না।
ধাপে ধাপে: PDF থেকে টেক্সট বের করা
- PDF থেকে Word/টেক্সট কনভার্টারে প্রবেশ করুন;
- PDF ফাইল লোড করুন;
- টুলটি প্রতিটা পৃষ্ঠার টেক্সট পড়ে এবং প্রিভিউ তৈরি করে;
- ফলাফল .docx (Word-এ এডিট চালিয়ে যাওয়ার জন্য) অথবা .txt (কোনো ফরম্যাটিং ছাড়া সাধারণ টেক্সট — অন্য কোনো সিস্টেম বা এডিটরে পেস্ট করার জন্য উপযোগী) হিসেবে ডাউনলোড করুন।
পুরো প্রক্রিয়াকরণ ব্রাউজারে হয়, যেকোনো আধুনিক ভিউয়ারে চলা একই PDF-পড়ার প্রযুক্তি ব্যবহার করে — ফাইলটা কোনো বাহ্যিক সার্ভারে পাঠানো হয় না।
কখন এটা ব্যবহার করা লাভজনক
আপনার একটা চুক্তি বা আবেদন PDF-এ আছে আর সামান্য পরিবর্তনসহ একটা নতুন সংস্করণ দরকার, মূল Word ফাইল ছাড়া — টেক্সট বের করে একটা নতুন নথিতে পেস্ট করে মৌলিক ফরম্যাটিং আবার প্রয়োগ করা শূন্য থেকে আবার টাইপ করার চেয়ে দ্রুত।
আপনি একটা প্রাতিষ্ঠানিক নথি PDF-এ পেয়েছেন আর তার অংশ উদ্ধৃত বা পুনরায় ব্যবহার করতে হবে অন্য একটা টেক্সটে — এক্সট্র্যাকশন দীর্ঘ ট্রান্সক্রিপশনে ম্যানুয়াল টাইপোর ভুল এড়ায়।
আপনার একটা নথির সাধারণ টেক্সট সংস্করণ দরকার কোনো সিস্টেম, ফর্ম বা এডিটরে পেস্ট করার জন্য যা PDF গ্রহণ করে না।
কখন এটা লাভজনক না (আর কী করবেন)
নথিতে যদি জটিল টেবিল, সংবাদপত্রের মতো কলাম, বা একটা বিস্তারিত লেআউট থাকে যা ভিজ্যুয়ালি বিশ্বস্তভাবে সংরক্ষণ করতে হবে, সাধারণ টেক্সট এক্সট্র্যাকশন সেটা স্বয়ংক্রিয়ভাবে পুনর্গঠন করবে না — এসব ক্ষেত্রে, বের করা টেক্সট থেকে Word-এ ম্যানুয়ালি কাঠামো আবার তৈরি করা এক্সট্র্যাকশনের ধরে না রাখা ফরম্যাটিং ঠিক করার চেষ্টার চেয়ে দ্রুত হতে পারে।
নথিটা যদি স্ক্যান করা হয়, টেক্সট এক্সট্র্যাকশন প্রযোজ্য না — বিকল্প, যখন মূল Word ফাইল সত্যিই কোথাও নেই, হলো কন্টেন্ট ম্যানুয়ালি টাইপ করা অথবা একটা ডেডিকেটেড OCR টুল ব্যবহার করা (এই টুলের আওতার বাইরে)।
সাধারণ প্রশ্নাবলী
এক্সট্র্যাকশন কি যেকোনো PDF-এ কাজ করে? নির্বাচনযোগ্য টেক্সটসহ PDF-এ কাজ করে (Word, ওয়েবসাইট বা অন্য এডিটর থেকে ডিজিটালিভাবে তৈরি বেশিরভাগ PDF)। স্ক্যান করা PDF-এ কাজ করে না, যেগুলো শুধু ছবি।
চেষ্টা করার আগে কীভাবে জানব আমার PDF-এ নির্বাচনযোগ্য টেক্সট আছে কিনা? যেকোনো রিডারে PDF খুলুন আর মাউস দিয়ে একটা শব্দ নির্বাচন করার চেষ্টা করুন। স্বাভাবিকভাবে হাইলাইট হলে, টেক্সট বের করা যাবে। কিছু না ঘটলে বা নির্বাচন পুরো পৃষ্ঠার "ছবি" ধরে ফেললে, এটা একটা স্ক্যান করা PDF।
তৈরি হওয়া Word ফাইল কি মূল PDF-এর মতো হুবহু ফরম্যাটিং নিয়ে বের হয়? না — সঠিক টেক্সট বের হয়, লাইন ও পৃষ্ঠা অনুযায়ী গোছানো, কিন্তু সাধারণ ফরম্যাটিংয়ে। ভিজ্যুয়াল ফরম্যাটিং (বোল্ড, টেবিল, কলাম) প্রয়োজন অনুযায়ী ম্যানুয়ালি আবার প্রয়োগ করতে হবে।
PDF-এর শুধু একটা অংশ বের করতে পারি? এক্সট্র্যাকশন পুরো নথি প্রসেস করে। শুধু একটা নির্দিষ্ট সেকশন দরকার হলে, টেক্সট বের করার আগে অপ্রয়োজনীয় পৃষ্ঠাগুলো মুছুন।
এটা কি একটা OCR প্রোগ্রামের বিকল্প? না — OCR নির্দিষ্টভাবে স্ক্যান করা (ছবি) উৎসের PDF-এর জন্য দরকার। এই টুলের এক্সট্র্যাকশন ফাইলে ইতিমধ্যে ডিজিটালিভাবে থাকা টেক্সট পড়ে; এটা টেক্সটের ছবি "পড়ে" না।
নথি এডিটিংয়ের সম্পূর্ণ প্রবাহ
- মূল PDF থেকে টেক্সট বের করুন;
- একটা মডেল পূরণ করুন যদি লক্ষ্য হয় কাঠামোটা একাধিক নথিতে পুনরায় ব্যবহার করা — বিস্তারিত আমাদের গাইডে;
- Word পরিষ্কার করুন মেটাডেটা থেকে নতুন সংস্করণ শেয়ার করার আগে — বিস্তারিত আমাদের গাইডে;
- চূড়ান্ত নথির অখণ্ডতা যাচাই করুন, যদি সংস্করণের ট্রেসেবিলিটি গুরুত্বপূর্ণ হয়।
প্রয়োগ করতে প্রস্তুত?
বিনামূল্যে, নিবন্ধন ছাড়াই — আপনার ফাইল কখনও আপনার কম্পিউটার ছেড়ে যায় না।
এখনই টেক্সট বের করুন — বিনামূল্যে