RoseLab
Entrar
ব্লগে ফিরে যানডকুমেন্ট প্রসেসিং ২৭ জুলাই, ২০২৬ 4 মিনিট পড়া

পুরো নথি আবার টাইপ না করে PDF-এর টেক্সট Word-এ কীভাবে বের করবেন

মূল ফাইল হারিয়ে গেছে আর শুধু PDF আছে? পুরো নথি আবার টাইপ না করে PDF থেকে Word-এ টেক্সট বের করা শিখুন। এই এক্সট্র্যাকশন কী সংরক্ষণ করে, কী হারায়, আর কখন কাজ করে না (স্ক্যান করা PDF) তা জানুন।

Equipe RoseLab Verificado

দৃশ্যটা সাধারণ: আপনার একটা চুক্তি, পুরোনো খসড়া বা প্রাতিষ্ঠানিক নথি এডিট করা দরকার, কিন্তু যে ফাইলটা আছে তা শুধু PDF — মূল .docx হারিয়ে গেছে, অন্য কোনো কম্পিউটারে থেকে গেছে, অথবা কখনোই ছিল না (নথিটা অন্য কারও বা অন্য প্রতিষ্ঠানের কাছ থেকে তৈরি হয়ে এসেছে)। পৃষ্ঠার পর পৃষ্ঠা আবার টাইপ করা শেষ বিকল্প; PDF থেকে সরাসরি একটা এডিটযোগ্য ফরম্যাটে টেক্সট বের করা বেশিরভাগ ক্ষেত্রে সমাধান করে দেয়।

এই এক্সট্র্যাকশন কারিগরিভাবে কী করে

টেক্সট এক্সট্র্যাকশন PDF-এর ভেতরে ইতিমধ্যে থাকা টেক্সট স্তর পড়ে — একই টেক্সট যা আপনি PDF রিডারে ফাইলটা খুলে মাউস দিয়ে নির্বাচন ও কপি করতে পারেন — এবং সেটাকে একটা Word (.docx) নথি বা সাধারণ টেক্সট (.txt) ফাইলে পুনর্গঠিত করে, এডিট করার জন্য প্রস্তুত।

এটা কাজ করে কারণ একটা "স্বাভাবিকভাবে জন্ম নেওয়া" PDF (Word, একটা ওয়েবসাইট বা যেকোনো এডিটর থেকে তৈরি — স্ক্যান করা না) টেক্সটকে টেক্সট হিসেবে সংরক্ষণ করে, ছবি হিসেবে না। প্রতিটা অক্ষরের ফাইলের ভেতরে একটা জানা অবস্থান ও মান আছে, যা টেক্সট কন্টেন্ট বিশ্বস্তভাবে পুনর্গঠন করতে দেয়।

এক্সট্র্যাকশন কী সংরক্ষণ করে — আর কী করে না

সম্পূর্ণ টেক্সট কন্টেন্ট, পৃষ্ঠায় যে ক্রমে আছে ঠিক সেই ক্রমে।

পৃষ্ঠা বিরতি, নথির মূল বিভাজন বজায় রেখে।

⚠️ উন্নত ভিজ্যুয়াল ফরম্যাটিং স্বয়ংক্রিয়ভাবে পুনর্গঠিত হয় না — বোল্ড, ইটালিক, ফন্ট সাইজ, রং, জটিল টেবিল এবং মূল PDF-এর একাধিক কলাম তৈরি করা Word-এ এডিটযোগ্য ফরম্যাটিং হিসেবে পুনরায় তৈরি হয় না; ফলাফল সাধারণ ফরম্যাটিংয়ের টেক্সট, যেখানে আপনি প্রয়োজনীয় ফরম্যাটিং আবার প্রয়োগ করতে পারবেন।

⚠️ ছবি টেক্সটের সাথে বের হয় না — নথিতে লোগো, স্ক্যান করা স্বাক্ষর বা এমবেড করা ছবি থাকলে, সেগুলো আলাদাভাবে সামলাতে হবে (যেমন, প্রয়োজনে পুরো পৃষ্ঠাটা ছবি হিসেবে বের করতে PDF থেকে ছবি কনভার্টার দিয়ে)।

স্ক্যান করা PDF (ছবি, টেক্সট স্তর ছাড়া) এভাবে বের করা যায় না। একটা স্ক্যান করা নথি — কাগজের একটা ডিজিটাইজেশন, একটা পুরোনো চুক্তির ছবি — কারিগরিভাবে PDF-এর ভেতরে একটা ছবি, পেছনে কোনো নির্বাচনযোগ্য টেক্সট ছাড়াই। এই ধরনের ফাইল থেকে টেক্সট বের করতে OCR (অপটিক্যাল ক্যারেক্টার রিকগনিশন) লাগবে, একটা আলাদা প্রক্রিয়া যা এই টুল করে না। এক্সট্র্যাকশন ব্যবহারের আগে পরীক্ষা করুন: একটা সাধারণ রিডারে মাউস দিয়ে PDF-এর টেক্সট নির্বাচন ও কপি করতে পারলে, এক্সট্র্যাকশন কাজ করবে; "টেক্সট" আসলে নথির একটা ছবি হলে, কাজ করবে না।

ধাপে ধাপে: PDF থেকে টেক্সট বের করা

  1. PDF থেকে Word/টেক্সট কনভার্টারে প্রবেশ করুন;
  2. PDF ফাইল লোড করুন;
  3. টুলটি প্রতিটা পৃষ্ঠার টেক্সট পড়ে এবং প্রিভিউ তৈরি করে;
  4. ফলাফল .docx (Word-এ এডিট চালিয়ে যাওয়ার জন্য) অথবা .txt (কোনো ফরম্যাটিং ছাড়া সাধারণ টেক্সট — অন্য কোনো সিস্টেম বা এডিটরে পেস্ট করার জন্য উপযোগী) হিসেবে ডাউনলোড করুন।

পুরো প্রক্রিয়াকরণ ব্রাউজারে হয়, যেকোনো আধুনিক ভিউয়ারে চলা একই PDF-পড়ার প্রযুক্তি ব্যবহার করে — ফাইলটা কোনো বাহ্যিক সার্ভারে পাঠানো হয় না।

কখন এটা ব্যবহার করা লাভজনক

আপনার একটা চুক্তি বা আবেদন PDF-এ আছে আর সামান্য পরিবর্তনসহ একটা নতুন সংস্করণ দরকার, মূল Word ফাইল ছাড়া — টেক্সট বের করে একটা নতুন নথিতে পেস্ট করে মৌলিক ফরম্যাটিং আবার প্রয়োগ করা শূন্য থেকে আবার টাইপ করার চেয়ে দ্রুত।

আপনি একটা প্রাতিষ্ঠানিক নথি PDF-এ পেয়েছেন আর তার অংশ উদ্ধৃত বা পুনরায় ব্যবহার করতে হবে অন্য একটা টেক্সটে — এক্সট্র্যাকশন দীর্ঘ ট্রান্সক্রিপশনে ম্যানুয়াল টাইপোর ভুল এড়ায়।

আপনার একটা নথির সাধারণ টেক্সট সংস্করণ দরকার কোনো সিস্টেম, ফর্ম বা এডিটরে পেস্ট করার জন্য যা PDF গ্রহণ করে না।

কখন এটা লাভজনক না (আর কী করবেন)

নথিতে যদি জটিল টেবিল, সংবাদপত্রের মতো কলাম, বা একটা বিস্তারিত লেআউট থাকে যা ভিজ্যুয়ালি বিশ্বস্তভাবে সংরক্ষণ করতে হবে, সাধারণ টেক্সট এক্সট্র্যাকশন সেটা স্বয়ংক্রিয়ভাবে পুনর্গঠন করবে না — এসব ক্ষেত্রে, বের করা টেক্সট থেকে Word-এ ম্যানুয়ালি কাঠামো আবার তৈরি করা এক্সট্র্যাকশনের ধরে না রাখা ফরম্যাটিং ঠিক করার চেষ্টার চেয়ে দ্রুত হতে পারে।

নথিটা যদি স্ক্যান করা হয়, টেক্সট এক্সট্র্যাকশন প্রযোজ্য না — বিকল্প, যখন মূল Word ফাইল সত্যিই কোথাও নেই, হলো কন্টেন্ট ম্যানুয়ালি টাইপ করা অথবা একটা ডেডিকেটেড OCR টুল ব্যবহার করা (এই টুলের আওতার বাইরে)।

সাধারণ প্রশ্নাবলী

এক্সট্র্যাকশন কি যেকোনো PDF-এ কাজ করে? নির্বাচনযোগ্য টেক্সটসহ PDF-এ কাজ করে (Word, ওয়েবসাইট বা অন্য এডিটর থেকে ডিজিটালিভাবে তৈরি বেশিরভাগ PDF)। স্ক্যান করা PDF-এ কাজ করে না, যেগুলো শুধু ছবি।

চেষ্টা করার আগে কীভাবে জানব আমার PDF-এ নির্বাচনযোগ্য টেক্সট আছে কিনা? যেকোনো রিডারে PDF খুলুন আর মাউস দিয়ে একটা শব্দ নির্বাচন করার চেষ্টা করুন। স্বাভাবিকভাবে হাইলাইট হলে, টেক্সট বের করা যাবে। কিছু না ঘটলে বা নির্বাচন পুরো পৃষ্ঠার "ছবি" ধরে ফেললে, এটা একটা স্ক্যান করা PDF।

তৈরি হওয়া Word ফাইল কি মূল PDF-এর মতো হুবহু ফরম্যাটিং নিয়ে বের হয়? না — সঠিক টেক্সট বের হয়, লাইন ও পৃষ্ঠা অনুযায়ী গোছানো, কিন্তু সাধারণ ফরম্যাটিংয়ে। ভিজ্যুয়াল ফরম্যাটিং (বোল্ড, টেবিল, কলাম) প্রয়োজন অনুযায়ী ম্যানুয়ালি আবার প্রয়োগ করতে হবে।

PDF-এর শুধু একটা অংশ বের করতে পারি? এক্সট্র্যাকশন পুরো নথি প্রসেস করে। শুধু একটা নির্দিষ্ট সেকশন দরকার হলে, টেক্সট বের করার আগে অপ্রয়োজনীয় পৃষ্ঠাগুলো মুছুন

এটা কি একটা OCR প্রোগ্রামের বিকল্প? না — OCR নির্দিষ্টভাবে স্ক্যান করা (ছবি) উৎসের PDF-এর জন্য দরকার। এই টুলের এক্সট্র্যাকশন ফাইলে ইতিমধ্যে ডিজিটালিভাবে থাকা টেক্সট পড়ে; এটা টেক্সটের ছবি "পড়ে" না।

নথি এডিটিংয়ের সম্পূর্ণ প্রবাহ

ফিচার্ড

প্রয়োগ করতে প্রস্তুত?

বিনামূল্যে, নিবন্ধন ছাড়াই — আপনার ফাইল কখনও আপনার কম্পিউটার ছেড়ে যায় না।

এখনই টেক্সট বের করুন — বিনামূল্যে