শ্যানন এনট্রপি
অনুব্রত ভট্টাচার্য · 20 August 2026
আজ থেকে প্রায় ৭৮ বছর আগে ক্লড শ্যানন (Claude Shannon) আমরা এখন যেটিকে Information Theory বলি তার একদম গোড়ার দিকের একটা বিষয় নিয়ে চিন্তা করছিলেন। এই ব্যাপারটা বোঝার জন্য আমাদের একটু প্রেক্ষাপট প্রয়োজন।
ধরা যাক তোমাকে ( মানে পাঠককে ) আমাদের দেশের উত্তর পূর্বে মেঘালয় রাজ্যের চেরাপুঞ্জিতে পাঠানো হয়েছে। তোমার কাজ হল চেরাপুঞ্জি থেকে আগামী ১২ দিনের আবহাওয়া সম্পর্কে কলকাতায় জানান দেওয়া একটা বিশেষ বার্তা বা কোডেড message-এর মাধ্যমে। ১২ দিনের পরে তুমি ওখানে ভারতীয় ডাকে খামের মধ্যে একটা বিশেষ কাগজ পাঠাবে কলকাতায়। সেই কাগজে শুধু একটা ১২ অঙ্কের সংখ্যামালা প্রিন্টেড থাকবে যা শুধু 0 আর 1 দিয়ে তৈরি। এই সংখ্যামালা বা স্ট্রিং তৈরির নিয়মটা এরকম যে - প্রথম থেকে যততম দিনে বৃষ্টি হবে string-এর বাঁদিক থেকে ঠিক তত তম স্থানে 0 থাকবে আর না হলে 1 থাকবে। উদাহরণস্বরূপ, , এই স্ট্রিং টার মানে হল যে চেরাপুঞ্জিতে তৃতীয়, অষ্টম এবং দ্বাদশ দিন বাদে সবদিন বৃষ্টি হয়েছে, এই তিনটে দিন রোদ ঝলমলে ছিল। কিন্তু এখানে তুমি একটা ছোট সমস্যায় পড়েছ। এই যে বিশেষ কাগজে তুমি এই প্রিন্টেড সংখ্যামালাটা পাঠাবে সেটা একটা বিশেষ machine readable (মানে এই যন্ত্রটা শুধুমাত্র এই কাগজে লেখা থাকলেই information টা process করতে পারবে) হওয়া প্রয়োজন, আর এই কাগজে প্রিন্ট করার জন্য যে ধরনের প্রিন্টার প্রয়োজন তা চেরাপুঞ্জিতে নেই। অগত্যা তোমাকে কলকাতা থেকেই যা প্রয়োজন হতে পারে এরকম একটা এই বিশেষ কাগজে প্রিন্টেড ১২ ডিজিট string মেঘালয়ে নিয়ে যেতে হবে। তোমার পাঠানো তথ্য ভবিষ্যতের আবহাওয়া পূর্বাভাসের জন্য কোনও এক আন্তর্জাতিক database এ অন্তর্ভুক্ত করা হবে। এই কারণে ওই বিশেষ যন্ত্রের সাহায্যে নেওয়া হবে সমস্ত তথ্য সংরক্ষন-এর কাজে।
পাঠকের বা তোমার কাছে এতক্ষণে হয়তো সমস্যাটা স্পষ্ট হয়ে গেছে। চেরাপুঞ্জিতে কী আবহাওয়া হবে সেটা তো আগে থেকে নিশ্চিতভাবে জানা নেই ! যে কারবারে এই তথ্য সংগ্রহের প্রসঙ্গ, কিন্তু এখন থেকে তাহলে আগে থেকে কি করে সেই সংখ্যামালা এই বিশেষ কাগজে ছাপিয়ে নিয়ে যাওয়া সম্ভব যেটার সঙ্গে এই ১২ দিনের আবহাওয়া মিলবে? আগে দেখা যাক যে আগে এরকম কতগুলো সংখ্যামালা হতে পারে তা গোনা যায় কিনা। এককথায় উত্তর হল, যায়। সবমিলিয়ে 0, 1 দিনে ১২ অঙ্কের (মানে 2x 2x...x2, ১২ বার গুণ) string তৈরি করা যায়। কারণ ১২ টা জায়গায় ০ বা ১ করে বসানো যায়, অর্থাৎ প্রত্যেক স্থানে দুটো choice আছে, সেজন্য ১২ টা জায়গায় ২ কে বারো বার গুণ করে পাওয়া যাবে। কিন্তু বিশাল একটা সংখ্যা, এবং এজন্য প্রচুর সময় এবং খরচা আছে, যে দুটোর কোনটাই ধরা যাক এই মুহূর্তে নেই। কিন্তু দেখ এইভাবে ভাবাটাও একটু অবাস্তবিক। আমরা এইভাবে আমাদের দৈনন্দিন জীবনে সিদ্ধান্ত নিই না। আমরা ছোট বড় সমস্ত সিদ্ধান্তই নিই সম্ভাবনার উপর ভিত্তি করে। হঠাৎ করে কেউ সাধারণত যে সময়ে অফিসে বের হয় তার ৮ ঘণ্টা আগে বের হয় না, এই ভেবে যে যদি রাস্তায় অসামান্য পরিমাণ ট্র্যাফিক জ্যাম হয় তাহলে এই সময়টা হাতে রাখা উচিত। বা নটায় গেলে আগে যদি কোন ট্রেন দুর্ঘটনা ঘটে তাহলে লাইনের সব ট্রেনই অনেক দেরিতে চলবে এই ভেবে। কিন্তু দুটোই তো হয়। এবং যে কোন দিন হতেও পারে। ট্রেন বা বাস দুর্ঘটনার কথা ভেবে আমরা যে ট্রেনে বাসে চড়ি না তাও না। তাহলে আমরা সিদ্ধান্তটা নিই কিসের উপর ভিত্তি করে? সম্ভাবনার উপর। দুর্ঘটনার সম্ভাবনা এতটাই কম যে এইটুকু ঝুঁকি নেওয়াই যায়। নাহলে জীবন স্তব্ধ হয়ে যাবে এবং সকালবেলা ঘুম থেকে ওঠার কোন কারণই থাকবে না। তো আবহাওয়ার খবর জানাতেও তুমি একই রকম একটা জিনিস করবে। চেরাপুঞ্জিতে অত্যন্ত বেশি পরিমাণ বৃষ্টিপাত হয়। আগের বছরগুলোর আবহাওয়া দপ্তরের রিপোর্ট ঘেঁটে তুমি দেখলে যে সময়টা চেরাপুঞ্জি যাচ্ছ তার আশেপাশে দু-তিন মাস নিয়ম করে প্রতি বছর গড়ে ১০ দিনের মধ্যে ৯ দিন বৃষ্টি হয়। মানে বৃষ্টির সম্ভাবনা ৯/১০ এবং রোদ ঝলমলে থাকার সম্ভাবনা ১/১০। তাহলে আশা করা যায় যে তোমার কাটানো ১২ দিনের মধ্যে ১২/১০ ~ ১.২ দিন বৃষ্টি হচ্ছে। অর্থাৎ আনুমানিক ১ দিন ( ‘~’ চিহ্নটার মানে আনুমানিক বা কাছাকাছি মানকে বোঝানো। ‘a ~ b’ মানে a আর b যথেষ্ট কাছাকাছি a=b এর মত ভাবা যেতে পারে) তাহলে ১২ অঙ্কের যে string টা সবচেয়ে কাজে লাগার সম্ভাবনা বেশি যাতে আনুমানিক একটা ১ আছে এবং বাকি সব ০। যেমন ধরো, - এই string টা কাজে লাগার কোন সম্ভাবনাই প্রায় নেই। ফলতঃ সীমিত কাগজ, কালি এবং সময়ে এই string টা সাথে না নিয়ে শুধু এরকম 12 digit string গুলো নিয়ে যাওয়াই ভাল যাতে একটা জায়গায় 1 আছে আর বাকি জায়গায় 0। এবার একটা অঙ্ক কষা যাক - আমি একটা general পরিস্থিতি কল্পনা করছি। ধরা যাক তোমাকে n দিনের আবহাওয়ার খবর দিতে বলা হল (n একটা variable বা চলরাশি, আমাদের উদাহরণে n=12 ছিল)। যেহেতু রোদঝলমল থাকার সম্ভাবনা ১/১০ আর রোদঝলমল থাকলে সেদিনের জায়গায় ১ বসবে, তাই আশা করা যে একটা সম্ভাব্য n-digit string-এ n/10 টা 1 থাকবে (খেয়াল রেখো যে আমাকে এখন একটা n-digit string পাঠাতে হবে)।
তাহলে প্রথম প্রশ্ন হল যে এরকম কটা n digit string আছে। আমি যদি একটা n-digit string কে বাঁদিক থেকে ডানদিকে 1 থেকে n নম্বর লেখা বাক্স রাখা আছে, এরকম ভাবি তাহলে প্রশ্নটা দাঁড়ায় যে কোন কোন নম্বর বাক্সে 1 বসাচ্ছি (কারণ - বাকিগুলোতে এমনিই 0 বসবে), অর্থাৎ আমি 1, 2, ..., n এই সংখ্যাগুলোর মধ্যে আন্দাজ কতভাবে n/10 টি সংখ্যা নির্বাচন করতে পারি, সেটা বুঝতে হবে। যারা XI, XII -এ বিন্যাস ও সমবায়- এর বিষয়ে পড়েছ, তারা বুঝতে পারবে যে এই সংখ্যাটা হল বা ( যেখানে )। বলে নেওয়া ভালো যে আমরা এই সংখ্যাটাকে একটা আনুমানিক মান হিসাবে নিচ্ছি, কারণ পূর্ণসংখ্যা নাও হতে পারে কিন্তু n যত বড়ো হবে, এটা তত ভালো একটা approximation হবে। এই সংখ্যাটাকে লিখলাম। সারমর্ম হল যে, আমি যদি এই W(n) সংখ্যক n-digit string সঙ্গে নিয়ে যাই, তাহলে বিশেষ ভুল-ত্রুটি ছাড়াই actual weather profile এর কাছাকাছি একটা n-digit string পাঠানোর সম্ভাবনা পাঠিয়ে বার্তা দেওয়ার সম্ভাবনা থাকবে।
এই গৌরচন্দ্রিকার পরে আবার প্রবন্ধের শুরুর বিষয়ে ফেরা যাক। Claude Shannon ঠিক এই সমস্যাটা নিয়েই ভাবছিলেন। কারো কাছে আন্দাজ কতগুলো n-digit string বা pattern থাকলে এমনভাবে তথ্য সম্প্রচার করা যাবে যাতে ভুল-ত্রুটির সম্ভাবনা n বড়ো হওয়ার সাপেক্ষে কমতে কমতে নগণ্য হয়ে যায়।
আবার এই W(n) -এর বিবরণে ফেরা যাক। W(n) = , এই যে ফর্মুলা সেটাকে আমরা generalize করার চেষ্টা করব। আমি এখানে 1/10 কে একটা variable দিয়ে পালটে দিলাম। এখানে কোন একটা ঘটনার সম্ভাবনা প্রকাশ করবে। অর্থাৎ হচ্ছে 0 থেকে 1 এর মধ্যে কোন একটা বাস্তব সংখ্যা। n যত বড় হতে থাকে ততই এর একটি সুন্দর আনুমানিক মান পাওয়া যায় যে, । একে Stirling’s Approximation ও বলা হয়। এখন,
বা,
Stirling’s Approximation থেকে পাওয়া যায় যে,
}.
অতএব সরলীকরণ করে পাই যে,
, যখন n-এর মান খুব বড়। (কারণ, ), বড় হওয়ার সাথে শূন্যের দিকে যায়। এর একটা নাম দেওয়া যাক, । মনে রাখা প্রয়োজন যে n-এর বড় মানের জন্য বা, । অর্থাৎ H হল W(n)-এর exponential growth rate।
এই ডানদিকের জিনিসটাই আমাদের কাছে গুরুত্বপূর্ণ হয়ে দাঁড়াবে। এর একটা নাম দেওয়া যাক, মনে রাখা প্রয়োজন যে n-এর বড় মানের জন্য , অর্থাৎ H হল W(n)-এর exponential growth rate।
আমরা এবার একটা সম্পূর্ণ অন্য প্রসঙ্গে যাব। এমন একটা মানবিক অনুভূতিকে গাণিতিক ভাষায় বর্ণনা করতে হবে যা আমাদের ব্যক্তিজীবনকে প্রায় চালনাই করে বলা চলে। আমি expectation বা প্রত্যাশার কথা বলছি। জীবনে কোনো ঘটনা থেকে কতটা আশা করা যায়, তাকে মাপার একটা উপায় চাই। একটা উদাহরণ নেওয়া যাক। ধরা যাক, যে একটা fair coin toss করা হচ্ছে। মানে Heads(H) এবং Tails(T) দুটো পড়ার সম্ভাবনাই 1/2 করে। ধরে নেওয়া যাক, যে H পড়লে আমি 10 টাকা পুরস্কার পাব আর T পড়লে আমাকে 10 টাকা দিতে হবে। যদি এই coin টা বারবার টস করে যাই আর জিজ্ঞেস করি যে আমি গড়ে কতটাকা পাব, তোমরা না ভেবেই উত্তর দেবে যে 0 টাকা। কারণ- গড়ে যতবার H পড়ার সম্ভাবনা ঠিক ততবারই সম্ভাবনা T পড়ারও। ফলত, কেটেকুটে লাভ-লোকসান কিছুই থাকবে না। এবার একটু স্বাদবদল করা যাক। ধরা যাক, H পড়লে 10 পাব আর T পড়লে 5 পাব। তাহলে যদি দুবার টস করি, গড়ে একবার H এবং একবার T পড়বে আর আমি 10+5 = 15 টাকা পাব। এটাকে গড় করলে হয় 7 1/2 টাকা। যদি 4 বার টস করি তাহলে গড়ে দুবার H আর দুবার T পড়বে। সবমিলিয়ে হাতে আসে 30 টাকা। তা গড় করলে আবার 7 1/2 টাকা। 6 বার বা 8 বার টস করলেও একই ব্যাপার হবে, আমি (1/2 x 10 + 1/2 x 5) = 7 1/2 টাকাই পাচ্ছি। তাহলে যদি 2k বার টস করা হয়, তাহলে সম্ভাব্য সবমিলিয়ে (10k+ 5k)= 15k টাকা পাওয়া যায়। অর্থাৎ গড় করলে আবার 7 1/2 টাকা। এবার যদি (2k+ 1) বার টস করা হয়, তাহলে সম্ভাব্য (10k+5k+5) এবং (10k+5k+10) - এর মধ্যে কোনো একটা টাকার অঙ্ক হাতে আসে। এদের গড় করলে দাঁড়ায় যথাক্রমে এবং । n বড়ো হতে থাকলে , দুটোই ছোটো হতে হতে 0 এর কাছে চলে যায় আর , -এর কাছাকাছি যেতে থাকে, অর্থাৎ, K বড়ো হতে থাকলে আবার গড়ে সেই 7 1/2 টাকাই পাওয়া যায়, সে জোড় বা বিজোড় যতবারই টস করিনা কেন। অর্থাৎ আমি expect করতে পারি যে গড়ে 7 1/2 টাকা পাব। আবারো স্বাদবদল করা যাক। ধরা যাক, আমাদের coin-টা একটু বিগড়েছে। কোনো কারণে তিনবার টস করলে গড়ে দুবার H আর একবার T পড়ছে। এবার H পড়লে 6 টাকা পাব আর T পড়লে 3 টাকা দিতে হবে। তাহলে, 3n বার টস করলে সম্ভাব্য 2n বার H আর n বার T পড়বে [অর্থাৎ, (2n x 6 - n x 3) টাকা পাওয়া যাবে]। যদি (3n+1) বার টস করা হয়, তাহলে পাওয়া যাবে (2n x 6 - n x 3 - 3) আর (2n x 6 - n x 3 + 6) -এই দুটোর মধ্যে কোনো একটা অঙ্কের টাকা। (3n+2) বার টস করলে [(2n x 6 - n x 3) - 2 x 3] এর সমান বা এর চেয়ে বড়ো এবং [(2n x 6 - n x 3) + 2 x 6] -এর সমান বা এর চেয়ে ছোটো একটা অঙ্কের টাকা পাওয়ার সম্ভাবনা আছে। একটু আগে যেভাবে গড় নিয়ে দেখা হয়েছিল, ঠিক সেভাবেই দেখা যায় যে এই সবকটা ক্ষেত্রেই গড়ে (2/3 x 6 - 1/3 x 3) = (4 - 1) = 3 টাকা expect করতে পারি। তাহলে যদি Head পড়ার সম্ভাবনা p হয় এবং ফলত Tail পড়ার সম্ভাবনা (1-p) হয় এবং H পড়লে যদি M(p) টাকা এবং T পড়লে M(1-p) টাকা পাওয়া যায়, তবে গড়ে [pM(p) + (1-p)M(1-p)] টাকা পাওয়া যাবে, তা expect করা যায় (টাকা দিতে হলে M ঋণাত্মক হবে)। এই coin toss করাটাকেই একটা random experiment ভাবা যেতে পারে। অর্থাৎ এমন একটা experiment যার ফলাফল নিশ্চিত নয়, এবং তার [PM (p) + (1-p) M (1-p)] হল M এর expectation, এই random experiment এর ফলাফল হিসাবে।
আবার information compression এর প্রশ্নে গেলামই বা কখন কিন্তু একটু খেয়াল করলেই পাঠক বুঝতে পারবে যে, আমরা যে শুধু এই প্রশ্নে গেছি তাই নয়, আমরা এই বিষয়ে বিস্তর আলোচনা করে ফেলেছি | পাঠকের মনে পড়বে, আমাদের প্রথম উদাহরনে যেখানে সবমিলিয়ে টি combination ছিল, সেটাকে আমরা সংখ্যক সম্ভাব্য combination এ কমিয়ে এনেছিলাম, শ্যানন বুঝতে পারেন যে, W(n) এর সঙ্গে আর একটা মানবিক অনুভুতির সম্পর্ক রয়েছে - বিস্ময় বা surprise | এতক্ষণে পরিষ্কার যে, W(n) এর চেয়ে কমসংখ্যক n-digit string যদি পাঠাতে হয়, তাহলে তথ্যবিকৃতি ঘটবে, কারণ — W(n) সংখ্যক প্রতিটি string ই উপলব্ধ হওয়ার সম্ভাবনা আছে, অর্থাৎ, W(n) যত বড়ো হবে ততই একটা নির্দিষ্ট weather pattern আবিষ্কারে আমাদের বিস্ময়ও বাড়বে, W(n) কে আমরা এই আবহাওয়ার n দিনের information complexity- এর একটা পরিমাপ হিসাবে ভাবতে পারি, এই বিষয়ে আমরা পরে কথা বলব। যাই হোক, বিস্ময়ের অনুভূতিকে এই প্রেক্ষাপটে একটি গাণিতিক ভিত্তির উপর দাঁড় করানোর প্রচেষ্টা করা যাক, অর্থাৎ, আমরা এবার বিস্ময় মাপব।
যদি একটা fair coin দুবার টস করা হয়, তবে HH, HT, TH, TT - এই ৪টি ফলাফল হতে পারে। বলার সুবিধার্থে কিছু ঘটনা (event) এর নামকরণ করা যাক,
Event A → পরপর দুটো টসেই H পড়া
Event B → অন্তত একটা টসে H পড়া
Event C → অন্তত একটা টসে T পড়া
A ঘটার একমাত্র উপায় হল HH উপলব্ধ হওয়া অর্থাৎ A ঘটার সম্ভাবনা মান P(A) = 1/4 ( P(A) এর মাধ্যমে A ঘটার সম্ভাবনা বা probability বোঝানো হচ্ছে)। B ঘটতে পারে HH, HT, TH, এর মধ্যে যেকোনো একটা ঘটলেই ফলত P(B) = 3/4, স্বাভাবিকভাবেই আমরা A ঘটলে B ঘটার চেয়ে বেশি বিস্মিত হব। আবার লক্ষ্য করে দেখা যায় যে P(C) = 3/4। অর্থাৎ, B এবং C ঘটলে সমপরিমাণ বিস্মিত হব কারণ এই দুটো ঘটনা ঘটার সম্ভাবনা সমান। এর থেকে বোঝা যায় যে বিস্ময়, বা surprise ঠিক ঘটনাটি নয়, বরঞ্চ ঘটনাটির সম্ভাবনার উপর নির্ভর করে, এছাড়াও বিস্ময় এর দ্বিতীয় নিয়ম হল যে কোন ঘটনা ঘটার সম্ভাবনা যত বাড়বে ততই বিস্ময় কমবে, surprise কে যদি একটি অপেক্ষক (function) S হিসাবে ভাবা যায় তাহলে এটি ক্রমহ্রাসমান, আমাদের আপাতত আলোচনার সুবিধার জন্য, S : [0, 1] [0, ∞] এবং, S হল ক্রমহ্রাসমান বা decreasing, S(0) = ∞, S(1) = 0, এর কারণ হল যে অসম্ভব ঘটনায় অসীম পরিমাণ surprise অনুভূত হয় বা S(0) = ∞, আবার যেটা নিশ্চিত ঘটনা, তা ঘটায় কোন বিস্ময়ই অনুভব করি না, তাই S(1) = 0, কারণ নিশ্চিত ঘটনার সম্ভাবনা 1। এখানে বলে রাখা দরকার যে, S(0)= ∞ ব্যাপারটা গাণিতিকভাবে খুব একটা যুক্তযুক্ত নয়, বরঞ্চ বলা উচিত যে ঘটনার সম্ভাবনা যত ছট হয়ে 0 এর দিকে যাবে, surprise S ঠিক ততই যে-কোনো বড়ো সংখ্যাকে একসময় ছাড়িয়ে যাবে, সে যত বড়োই হোক না কেন। অর্থাৎ , যারা limit এর সংজ্ঞার সঙ্গে পরিচিত তারা বুঝতে পারবে যে কি বলার চেষ্টা করা হচ্ছে। তবে কাজ চালানোর জন্য এখানে S(0) = ∞ বলব। আরেকটা সূক্ষ্ম ব্যাপার আছে, দুটো ঘটনা যখন সতন্ত্র or independent হয় তখন তাদের একসাথে ঘটার সম্ভাবনা তাদের প্রত্যেকের এককভাবে ঘটার সম্ভাবনার গুণফল হয়, এটাকে আমরা independent ঘটনার সংজ্ঞা হিসাবে নেব । এটা স্পষ্ট যে, X ও Y যদি দুটি independent event হয় এবং যদি এদের ঘটার সম্ভাবনা যথাক্রমে 𝞪 ও 𝛃 হয়, তাহলে X ⋂ Y ঘটায় (অর্থাৎ X ও Y একসাথে ঘটায়) পাঠক [S(𝞪) + S(𝛃)] পরিমাণ বিস্ময় অনুভব করবে। ধরা যাক, শীতকালে কলকাতায় বৃষ্টি শুরু হল, এই ঘটনায় কিছুটা বিস্ময় অনুভব হবে ঠিক, আবার ধরা যাক, এবার বাড়ির পাশের রাস্তায় হঠাৎ করে বাইক পিছলে রাস্তা থেকে সরে একটা accident ঘটে গেল। বৃষ্টির ঘটনাটিকে X ও accident এর ঘটনাটিকে Y বলা যায়, তোমার বাড়ির পাশের রাস্তা ভালো করে বাঁধানো এবং তাতে accident প্রায় হয় না বললেই চলে। হঠাৎ করে Y ঘটলে পাঠক যথেষ্ট বিস্মিত হবে, কিন্তু জিহেতু বৃষ্টির পরে accident টা ঘটেছে, এটা বোঝা যাই যে Y ঘটার পিছনে X এর অবদান রয়েছে, এর অর্থ হল যে দুটো মিলিয়ে যতটা বিস্মিত হওয়ার কথা তার থেকে কম বিস্ময় অনুভব হবে, কিন্তু এই Y ঘটনাটাই যদি ভারতের ফ্রাঞ্চে ফুটবল বিস্বাকাপ জেতা হয় তাহলে কিন্তু বিস্ময়গুলো যোগ হবে | কারন এখানে বৃষ্টি হওয়ার সাথে ফ্রান্সে ভারতের বিশ্বকাপ জেতার কোনো সম্পর্ক নেই।
একটা সহজ উদাহরণ নেওয়া যাক। আবার একটা fair coin দুবার টস করা হচ্ছে। প্রথমবার H পড়ার ঘটনাকে A ও দ্বিতীয়বার H পড়ার ঘটনাকে B বলা যাক। তাহলে A, B ও A ⋂ B কে সেট হিসাবে লিখলে পাব যে A হচ্ছে {HH, HT}, B হচ্ছে {HH, TH} আর A ⋂ B হচ্ছে {HT}। এবং সম্ভাব্য সমস্ত outcome এর set হল {HH, HT, TH, TT}। ফলত, A, B ও A ⋂ B ঘটার সম্ভাবনা যথাক্রমে । Independence এর আগে যে সংজ্ঞা দেওয়া হয়েছিল, তা থেকে দেখা যায় যে A, B স্বতন্ত্র or independent ঘটনা। এবার যদি surprise func নির্মাণের সময় এই independence এর ব্যাপারটা মাথায় রাখা যায়, তাহলে কী দেখা যাবে? A এবং B ঘটনাদুটি একসাথে ঘটার জন্য যদি পরিমাণ surprise অনুভূত হয়, তবে A ⋂ B বা A ও B একসাথে ঘটলে পরিমাণ surprise অনুভূত হবে। কিন্তু A ⋂ B ঘটার সম্ভাবনা , তাই A ⋂ B ঘটায় পরিমাণ surprise অনুভূত হয়। দুটোকে তুলনা করলে পাওয়া যায় যে, । এবার যদি এই বিষয়টিকে generalise বা সাধারণীকরণ করা যায়, তবে কী পাওয়া যাবে? A এবং B যদি স্বতন্ত্র ঘটনা হয় এবং A ও B ঘটার সম্ভাবনা যথাক্রমে p ও q হয়, তাহলে নিশ্চিত যে, S(pq) = S(p) + S(q), কারণ A ও B স্বতন্ত্র হওয়ায় A ⋂ B ঘটার ফলে [S(p) + S(q)] পরিমাণ বিস্ময় অনুভূত হবে, আবার A ⋂ B ঘটার সম্ভাবনা pq (A ও B স্বতন্ত্র হওয়ার কারণে)। ফলন, A ⋂ B ঘটায় অনুভূত surprise হল S(pq)। দুটোকে জুড়লে পাইরলS(pq) = S(p) + S(q)।
তাহলে surprise function এর মধ্যে আমরা কী কী চাই?
S : [0, 1] - [0, ∞]
S(0) = ∞, S(1) = 0, S(pq) = S(p) + S(q)
উপরন্তু কাজ করার সুবিধার্থে S কে continuous বা অবিচ্ছিন্ন ভাবতে কোনো ক্ষতি দেখা যায় না, এখান থেকে প্রমাণ করা যায় যে, S(p) = -ln(p) না হয়ে আর কোনো উপায় নেই! [S(p) = -\log_a p ও হতে পারে, যেখানে a > 01, আমরা convention হিসাবে a = e নিলাম।] অর্থাৎ যদি কোনো ঘটনা A ঘটার সম্ভাবনা p হয়, তাহলে A ঘটার ফলে S(p) = -\ln(p) পরিমাণ surprise অনুভূত হবে। তাহলে এখনো পর্যন্ত যা যা নিয়ে কথা হয়েছে, তা একবার একটু সংক্ষেপে স্মরণ করে নেওয়া যাক। একদম প্রথমে আবহাওয়া নামকরণের উদাহরণের মাধ্যমে আমরা কোনো binary random experiment (যার শুধুমাত্র দুটো ফলাফল – 0 এবং 1) এর information complexity এর সাথে পরিচিত হলাম, অর্থাৎ, যদি random experiment এর ফলাফল (outcome) কে 0 এবং 1 দিয়ে লেখা হয় এবং যদি 0 এবং 1 আসার সম্ভাবনা যথাক্রমে (1-p) ও p হয়, তাহলে n দিনের ঘটনাক্রম জানানোর জন্য সবচেয়ে সম্ভাব্য সংখ্যক n-digit binary string (অর্থাৎ 0, 1 দ্বারা নির্মিত) প্রয়োজন। আমরা দেখেছিলাম যে, , যখন n → ∞ (n যত বড়ো হয়ে অসীমের দিকে যাচ্ছে)।
এরপর আমরা expectation নিয়ে কথা বললাম। যদি দুটো ঘটনা ঘটার সম্ভাবনা q এবং (1-q) হয় এবং প্রথম ও দ্বিতীয় ঘটনায় যথাক্রমে M(q) এবং M(1-q) পরিমাণ টাকা পাওয়া যায়, তাহলে গড়ে [qM(q)/q) + (1-q) M(1-q)] পরিমাণ টাকা পাওয়া যাবে, তা expect করতে পারি, এবং শেষে দেখলাম কোনো ঘটনা A ঘটার সম্ভাবনা যদি p হয়, তাহলে A ঘটার ফলে S(p) = -ln(p) পরিমাণ বিস্ময় বা surprise অনুভূত হয়। মানে ঠিক এর আগের প্রেক্ষাপটটি দেখলে একটা binary event [মানে যার দুটো outcome, একটার সম্ভাবনা p এবং অপরটির (1-p)] এর জন্য expected surprise হল । একটু পিছনে ফিরলেই দেখা যাবে যে এটা H(p) ব্যতীত আর কিছুই নয়। আমরা আগে লিখেছিলাম যে আমরা W(n) কে একটা binary event এর n বারের ঘটনাক্রমের যে information, তার complexity এর একটা মাপকাঠি হিসাবে ভাবতে পারি | আমাদের আলোচনা থেকে স্পষ্ট যে, n এর সাপেক্ষে W(n) এর যে exponential growth rate মানে , তা আসলে binary event টির expected surprise ছাড়া কিছুই না। এই H কেই বলা হয় শ্যানন এনট্রপি।
এনট্রপি শব্দটার উৎপত্তি পদার্থবিদ্যা থেকে, Thermodynamics যখন পড়ানো হয় তখন পাঠকদের সঙ্গে এই শব্দটার প্রথম পরিচয় হয়েছে। কোনো system এর বিশৃঙ্খলা পরিমাপ করতে এনট্রপি ব্যবহার করা হয়। তার সাথে তুলনা করেই আমাদের প্রেক্ষাপটেও এনট্রপি শব্দটা ব্যবহার করা যেতে পারে। একটা Random event এর থেকে আসা পর পর n বার এর ঘটনাক্রম অনুধাবন করা ততই কঠিন হবে যত randomness বাড়তে থাকবে | চেরাপুঞ্জিতে যদি টানা বৃষ্টি না হয় আবহাওয়া হঠাৎ করে রোদ ও বৃষ্টির মাঝে দোলাচলে রইত তবে এতটা নিশ্চিত হওয়া যেত না । এর মধ্যেও এই ব্যাপারটা ফুটে ওঠে, দুটো ঘটনা 0 ও 1 যদি সমান সম্ভাবনা ১/২ নিয়ে ঘটে তখন H(p) সর্বোচ্চ হয়। p=1/2 এ। এটাই এই Radom event এ সঞ্চিত তথ্য বা Information এর complexity-র পরিমাপক। শ্যানন বুঝতে পারেন যে তখনই সর্বোচ্চ হবে যখন যেকোনো ঘটনাক্রম উপলব্ধি তে দর্শক গড়ে সবচেয়ে বেশি আশ্চর্য হবেন । কোন বিষয়েরই অতি ব্যাখ্যা ভাল নয়, পাঠক নিজে উপলব্ধি করলেই সর্বোৎকৃষ্ট ধারণ তৈরি হয়। এনট্রপি নামকরণ এর প্রসঙ্গে একটা ছোট গল্প দিয়ে শেষ করি।
শ্যানন প্রথম এই H বস্তুটিকে 'Information' বলতে চেয়েছিলেন । কিন্তু শব্দটার অতিব্যবহারে চিন্তিত হয়ে স্থির করলেন যে H কে 'অনিশ্চয়তা' মানে 'uncertainty' বলবেন। সেটাও পরে মনঃপূত না হওয়ায় গেলেন কিংবদন্তী-পদার্থবিজ্ঞানী ও গণিতজ্ঞ জন ভন নয়ম্যান এর সাথে, এ বিষয়ে আলোচনা করতে। ভন নয়ম্যান তখন উপদেশ দেন যে H কে এনট্রপি নামকরণ করা যাক। প্রথম কারণটা হল যে Statistical mechanics এই একই নামে uncertainty function (আমরা যাকে S বলছি), ব্যবহার করা হয়েছে, আর দ্বিতীয় এবং আরও গুরুত্বপূর্ণ কারণ হল এই যে, কেউই ঠিকঠাক জানে না যে এন্ট্রপি বস্তুটা আসলে কি, ফলত এই নামকরণ নিয়ে যে কোনো তর্কে তুমি (মানে শ্যানন) আগেই দুই পা এগিয়ে থাকবে।
সূত্র: আমি এই লেখার সূত্র হিসাবে দুটি কৃতজ্ঞতা স্বীকার করতে চাই, প্রথমটি TIFR-CAM এর অধ্যাপক নিশান্ত চন্দগোটিয়া মহাশয় এর Thermodynamic formalism প্রসঙ্গে প্রথম দুটি লেকচার যা ২০২৪ সালের ডিসেম্বর আইআইটি তিরুপতির গণিত বিভাগে আয়োজিত হয়। দ্বিতীয় হল, সেপ্টেম্বর 6, 2022 এ কেভিন হার্নেট এর লেখা online article, "How Shannon Entropy Imposes Fundamental Limits on Communication", যা Quanta ম্যাগাজিনে এ ছাপা হয়।