কৃত্রিম বুদ্ধিমত্তা কি নির্ভরযোগ্য?

এআই কি নির্ভরযোগ্য? [ভিডিও ও কুইজ]

সংক্ষিপ্ত উত্তর: এআই একটি বৈশিষ্ট্য হিসেবে নির্ভরযোগ্য নয়: এটি নির্ভর করে কাজটি, তথ্য সংগ্রহের প্রক্রিয়া এবং দায়িত্বে থাকা মানুষের উপর। আপটাইম হলো এন্ডপয়েন্টটি উত্তর দিয়েছে কি না; আর সত্যতা হলো উত্তরটি সঠিক ছিল কি না। যখন কোনো ভুল সস্তা বা সংশোধনযোগ্য হয়, তখন এটি ব্যবহার করুন; যখন ভুল ব্যয়বহুল হয়, তখন এর গতি কমিয়ে দিন।

মূল বিষয়গুলি:

জবাবদিহিতা: কে পর্যালোচনা করবে, কে এটি থামাতে পারবে এবং কে এর জন্য দায়ী থাকবে, তা উল্লেখ করুন।

স্বচ্ছতা: পুনরুদ্ধার করা অংশটি পরীক্ষা করুন, নইলে আপনি এখনও ধোঁয়াশার মধ্যে থাকবেন।

নিরীক্ষণযোগ্যতা: প্রম্পট, পুনরুদ্ধার করা অংশ এবং প্রেরণের তথ্য লগ করুন, যাতে ত্রুটিগুলো শনাক্ত করা যায়।

অপব্যবহার প্রতিরোধ: অর্থ সংক্রান্ত প্রশ্নে ব্যর্থ হন; কখনও সংখ্যা, সুযোগ বা নীতি মনগড়াভাবে তৈরি করবেন না।

দৃষ্টান্তমূলক ফলাফল: ২০টি প্রশ্ন সম্বলিত একটি দৃষ্টান্তমূলক পরীক্ষাকে মানচিত্র হিসেবে বিবেচনা করুন, ৯৫% প্রমাণ হিসেবে নয়।

এআই কি নির্ভরযোগ্য? ইনফোগ্রাফিক

এর পরে আপনি যে প্রবন্ধগুলি পড়তে পছন্দ করতে পারেন:

🔗 দৈনন্দিন জীবনে এআই কীভাবে ব্যবহার করবেন:
এআই কীভাবে আপনার প্রতিদিনের কাজ ও রুটিনকে সহজ করে তুলতে পারে, তার কার্যকরী উপায়গুলো জানুন।

🔗 কর্মক্ষেত্রে এআই কীভাবে ব্যবহার করবেন:
এআই-এর সাহায্যে উৎপাদনশীলতা এবং কর্মদক্ষতা বাড়ানোর কার্যকরী উপায়গুলো জানুন।

🔗 কৃত্রিম বুদ্ধিমত্তা কি নিজে থেকে চিন্তা করতে পারে?
কৃত্রিম বুদ্ধিমত্তা সত্যিই স্বাধীনভাবে চিন্তা করতে এবং যুক্তি দিয়ে বিচার করতে পারে কিনা তা অন্বেষণ করুন।

🔗 কৃত্রিম বুদ্ধিমত্তার (AI) প্রকারভেদগুলো কী কী?
AI-এর প্রধান প্রকারভেদ, সক্ষমতা এবং মূল পার্থক্যগুলো সম্পর্কে জানুন।

যখন যন্ত্রটি একটি পরিসংখ্যানগত তোতাপাখি হয়, তখন "নির্ভরযোগ্য" বলতে আসলে কী বোঝায়?

সাধারণ কথায়, নির্ভরযোগ্যতা বলতে বোঝায় কোনো কিছুর ওপর নির্ভর করা যায়।.

কথা বলতে পারা অটোমেশনের ক্ষেত্রে, একটি শব্দের আড়ালে বিভিন্ন বৈশিষ্ট্যের সমাহার লুকিয়ে থাকে। বাস্তবতা। সামঞ্জস্য। ক্যালিব্রেশন – অর্থাৎ, মডেলের আত্মবিশ্বাস তার সঠিক হওয়ার সম্ভাবনার সাথে মেলে কি না, নাকি এটি শুধু... নিশ্চিত শোনাচ্ছে। নিরাপত্তা। আপটাইম। প্রম্পট সংবেদনশীলতা। প্রান্তিক পরিস্থিতিতে আচরণ। ডিস্ট্রিবিউশন পরিবর্তনের পর আচরণ, যখন বাস্তব জগৎ আর ট্রেনিং জগৎ থাকে না। এগুলোর কোনোটিই একসাথে ব্যর্থ হয় না। আর এই অংশটুকুই মানুষ এড়িয়ে যায়।

একটি চ্যাটবট সারা সপ্তাহ ধরে সচল থাকতে পারে, কিন্তু মঙ্গলবার বিকেলে এসেই ভুল দেখাতে পারে। একজন কোডিং কো-পাইলট বয়লারপ্লেট কোডে দক্ষ হতে পারে, কিন্তু পরক্ষণেই এমন একটি এপিআই তৈরি করে ফেলতে পারে যা দেখতে হুবহু আসলটির মতো। এক্ষেত্রে মানুষ যে রূপকটি ব্যবহার করে তা হলো "একজন জুনিয়র সহকর্মী"। এটি একটি ত্রুটিপূর্ণ রূপক—জুনিয়ররা এতে বিব্রত বোধ করে—কিন্তু এটি "ওরাকল"-এর চেয়ে বেশি কাছাকাছি।.

লাইভ টেস্টটি কীসের জন্য, কার জন্যএবং এর চারপাশের লুপটি কী, তার জন্য নির্ভরযোগ্য। অন্যথায় আপনি একটি ব্লেন্ডারকে সেটি ট্যাক্স করতে পারে কি না, তার ওপর ভিত্তি করে গ্রেড দিচ্ছেন।

আপটাইম মানেই নির্ভরযোগ্যতা নয় - এ দুটি ভিন্ন ধরনের 'নির্ভরযোগ্য' বিষয়।

অপারেশনস বিভাগের লোক এবং সত্য উদঘাটনকারী ব্যক্তিরা একই শব্দ ব্যবহার করে এবং একে অপরের কথা বুঝতে পারে না।.

আপটাইম হলো "এন্ডপয়েন্টটি উত্তর দিয়েছে কি না"। আর সত্যবাদিতা হলো "উত্তরটি কি সেরকমই ছিল"। গভর্নেন্স এই দুটি বিষয়কেই গুরুত্ব দেয়, এবং মডেল রিস্ক এই দুইয়ের মাঝের বিশ্রী ফাঁকটিতে অবস্থান করে। আপনার এমন একটি সার্ভিস থাকতে পারে যা কখনো কোনো সমস্যা করে না, অথচ আপনি গ্রাহকের টিকেটে একটি সাবলীল মিথ্যা বার্তা পাঠিয়ে দিতে পারেন। SRE-এর দৃষ্টিকোণ থেকে এটি নির্ভরযোগ্য। কিন্তু "দয়া করে কোনো রিফান্ড পলিসি তৈরি করবেন না"—এই অর্থে নির্ভরযোগ্য নয়।.

আমার মনে হয়, এটা লিখে রাখলে স্পষ্টই বোঝা যায়। কিন্তু বিকেল ৪টায় ব্যাপারটা স্পষ্ট থাকে না, যখন উত্তর দ্রুত আসে আর লাইনটা বিশাল লম্বা হয়ে থাকে। গতিকে এখন দক্ষতার লক্ষণ বলে মনে হয়। আগে ধীরগতি মানেই ছিল কেউ ভাবছে। এখন গতিই হলো এই ইঙ্গিত যে কেউই ভাবছে না।.

নিরাপত্তা হলো আরও একটি দিক। যে মডেলটি একটি মারাত্মক জেলব্রেক প্রতিরোধ করে, সেটি নিরাপত্তা-মূল্যায়নের দিক থেকে 'নির্ভরযোগ্য' হলেও আপনার নিজের নোটের সারাংশকে হয়তো তখনও বিকৃত করে ফেলতে পারে।.

সাবলীল ও ভুল হওয়া, আনাড়ি ও স্পষ্টভাষী হওয়ার চেয়েও খারাপ।

এটাই হলো আত্মবিশ্বাসের সমস্যা, এবং এটাই সবচেয়ে বড় আঘাত।.

নির্ভুলতা আর সাবলীলতার মধ্যে বিচ্ছেদ হয়ে গেল, আর শেষ পর্যন্ত সাবলীলতাই বাড়িটা ধরে রাখল। একটি এলএলএম আপনাকে ছন্দ দেবে, সঠিক জায়গায় কৌশলী অবস্থান নিতে শেখাবে, হয়তো উদ্ধৃতির একটি ভুয়া কিন্তু সুন্দর কাঠামোও দেবে। আপনার মস্তিষ্ক ভাবে, "এই ব্যক্তি সব জানে"। কিন্তু আসলে সে কোনো ব্যক্তি নয়, এবং তার উপস্থাপনার মান প্রায়শই ভয়াবহ হয় — অত্যধিক আত্মবিশ্বাস, মাঝারি মানের সত্য, যা পরিবেশন করা হয় একটি মূল বক্তৃতার মতো।

একটি আনাড়ি ভুল উত্তর আপনাকে সন্দিহান করে তোলে। একটি সাবলীল ভুল উত্তর আপনাকে যাচাই করা থেকে বিরত রাখে। এটি কোনো সামান্য পার্থক্য নয়; একটি সামান্য কটু বাক্যেই পুরো গল্পটা বলা হয়ে যায়।.

এর মধ্যেও পক্ষপাতিত্ব লুকিয়ে থাকে, সবসময় গালি হিসেবে নয়, বরং ঘরে কারা আছে এবং কোন ধরনের ইংরেজিকে নিরপেক্ষ বলে গণ্য করা হবে, সেই বিষয়ে এটি একটি পূর্বনির্ধারিত ধারণা হিসেবে কাজ করে। মানুষ প্রতারিত হয় কারণ ভাষাই আমাদের সবচেয়ে পুরোনো বিশ্বাসের মাধ্যম। যদি কোনো কিছু সারসংক্ষেপের মতো শোনায়, আমরাও সেটিকে সারসংক্ষেপ হিসেবেই দেখি। আমি এই বিষয়ে আরও বেশি সংশয়ী হওয়ার কথা ভাবি। তারপর আমি একটি স্বচ্ছ সারসংক্ষেপ পড়ি আর আমার কাঁধ ঝুলে যায়। কোনো মিটিংয়ে ঢুকলে, সারসংক্ষেপটিকে সম্পূর্ণ বলে মনে হয়। ওই বাক্যটি একাই অনেক বেশি কাজ করে ফেলে, তবুও: এভাবেই ভুলটি নির্বাচিত হয়।.

ব্র্যান্ড নয়, পরিস্থিতি অনুযায়ী নির্ভরযোগ্যতা।

ব্র্যান্ডগুলো মনোযোগে ব্যাঘাত ঘটায়। যে তুলনাটি সার্থকতা এনে দেয়, সেটাই আসল কাজ। পক্ষগুলো নিজেদের মধ্যে তর্ক করবেই। তাতে কোনো সমস্যা নেই।.

ব্যবহারের ক্ষেত্র যেভাবে এটি ব্যর্থ হতে থাকে যখন এটা 'যথেষ্ট ভালো' একজন মানুষের এখনও যা করার আছে কেন মানুষ প্রতারিত হয়
খসড়া তৈরি / সারসংক্ষেপ ব্যতিক্রমটি বাদ দেয়; একটি 'হতে পারে' কে 'অবশ্যই' তে উন্নীত করে। প্রথমে এমন একটি টেক্সট পাস করুন যা আপনি ইতিমধ্যেই জানেন। নাম, নম্বর, যে লাইনটি কষ্ট দেবে তা পরীক্ষা করুন। মনে হচ্ছে এটা তোমারই মতো। পাঠিয়ে দাও।.
অনুসন্ধানমূলক প্রশ্নোত্তর কুয়াশার উত্তর; অল্পের জন্য রক্ষা পাওয়া উদ্ধারকে সত্য হিসেবে লেখা হলো অভিমুখীকরণ, শেষ কথা নয়। উৎসটি খুলুন, নইলে আপনার শুধু একটি অনুমান আছে। পুনরুদ্ধারকৃত এবং উদ্ভাবিত উভয়ের ক্ষেত্রেই একই সুর।
কোড সহায়তা উদ্ভাবিত এপিআই; বাগটি নিশ্চিত করার পরীক্ষা বয়লারপ্লেট, আঠা, "এই ত্রুটিটি ব্যাখ্যা করুন" এটা চালান। ডিফারেন্সটা পড়ুন। (একটু বেশি উপদেশ দিয়ে ফেললাম, দুঃখিত।) ঘরোয়া শৈলী। সবুজ-দর্শন পরীক্ষা।.
গ্রাহক সহায়তা উদ্ভাবিত নীতি; ভদ্র ভুল না একটি কঠোর নীতির মধ্যে খসড়া টাকা পাঠানোর দায়িত্ব নিন এবং বিশ্বাস রাখুন। দ্রুত ও সদয়। পাঁচ নম্বর বার্তাটি কেউ নিরীক্ষা করে না।.
চিকিৎসা / আইন-সংলগ্ন পরামর্শ সাবলীল, সুসংগঠিত, চূড়ান্তভাবে নিশ্চিত পণ্য হিসেবে প্রায় কখনোই না পেশাদার হোন। মডেলটি একটি অসম্পূর্ণ অংশ মাত্র। কথাটা শুনতে কঠোর লাগলে, ভালো।. কথাবার্তা সংক্ষিপ্তের মতো।.
স্কোরিং / র‍্যাঙ্কিং প্রক্সি বৈশিষ্ট্য; বিচ্যুতি; নিমজ্জিত প্রান্তিক ক্ষেত্র ট্রায়েজ আপনি ওভাররাইড করবেন লেজটি স্পট-চেক করুন সংখ্যাগুলোকে পরিণত মনে হয়। ড্যাশবোর্ডগুলোকে শাসনব্যবস্থা বলে মনে হয়। কিন্তু এককভাবে এগুলো তা নয়।.
চিত্র তৈরি হাত, অতিরিক্ত কনুই, গতানুগতিকতার উচ্ছিষ্ট মুডবোর্ড, ফেলে দেওয়ার মতো কম্প - কোনো প্রমাণ নয় শুধু শিল্পকর্ম নয়, অর্থের দিকেও দুবার তাকান। প্রিটি সংশয়বাদী অংশটুকু চুপ করিয়ে দেয়।
স্বায়ত্তশাসিত এজেন্ট একটি আত্মবিশ্বাসী টুল কল; যে ভুলগুলো বাড়তে থাকে কিল সুইচ সহ সংকীর্ণ লুপ বড়শিতে আটকে থাকুন। যা কিছু স্পর্শ করতে পারে, তা সীমাবদ্ধ করুন।. সংখ্যাযুক্ত পরিকল্পনাকে দক্ষতার পরিচায়ক বলে মনে হয়। প্রায়শই এটি একটি কার্যসম্পাদনকারী তালিকা।.

যাইহোক। যদি আপনার প্রিয় টুলটি খসড়া তৈরিতে পারদর্শী হয় এবং মাঝরাতে আপনি আইনি-সংক্রান্ত স্বস্তির জন্য সেটির কাছে আবদার করেন, তবে সেটা কোনো উন্নতি নয়। এর মানে হলো, মানচিত্রটি বলছে যে আপনি পথভ্রষ্ট হয়েছেন।.

বিভ্রম, লক্ষ্যহীনতা, এবং এক নীরব ভুল।

বিভ্রম শিরোনামে আসে কারণ এটি বেশ চাঞ্চল্যকর: এমন একটি বই যার কোনো অস্তিত্ব নেই, এমন একটি ফাংশন যা কখনো চালু করা হয়নি, এবং এমন একটি নীতিমালার ধারা যার সংখ্যাটি বেশ আনুষ্ঠানিক বলে মনে হয়।

ড্রিফট ততটা সিনেম্যাটিক নয়। পৃথিবী গতিশীল। মডেলের অবশিষ্ট অংশগুলো থেকে যায়। আপনি এমন একটি প্রশ্ন করেন যার জন্য নতুন প্রেক্ষাপট প্রয়োজন, আর তার উত্তরে পেয়ে যান পূর্ববর্তী আবহাওয়ার তথ্য থেকে একটি সুসংগঠিত জবাব। আমি প্রায় লিখেই ফেলেছিলাম "অন্য এক যুগের" কথা, যা এই বিষয়টির ক্ষেত্রে একটি অতিশয়োক্তি। এটা অন্য কোনো যুগ নয়। এটা কেবল বর্তমান নয়।.

নীরব ভুলটাই আমার কাছে বেশি গুরুত্বপূর্ণ। এমন এক সারসংক্ষেপ যা ব্যতিক্রমকে বাদ দেয়। এমন এক ভাবানুবাদ যা ‘হতে পারে’-কে ‘অবশ্যই’-তে উন্নীত করে। তথ্যনিষ্ঠা ‘প্রযুক্তিগতভাবে ঠিক’ থাকতে পারে, কিন্তু তার অর্থ বিচ্যুত হয়ে যায়।.

প্রম্পট সংবেদনশীলতা পরিস্থিতিকে আরও খারাপ করে তোলে। মোড়কটা বদলালেই ‘তথ্য’-এর ঔজ্জ্বল্য বদলে যায়। সংশয়বাদীর মতো জিজ্ঞাসা করলে এড়িয়ে যাওয়ার কৌশল পাবেন। তাড়াহুড়োয় থাকা বসের মতো জিজ্ঞাসা করলে চটজলদি অতিরঞ্জিত দাবি পাবেন। আপনার মূল্যায়নে যদি কেবল একটিই পোশাক ব্যবহৃত হয়, তবে আপনার মূল্যায়নটি কিছুটা মিথ্যে। দুঃখিত।.

জেল পালানোর ঘটনাগুলো এক ধরনের সীমারেখায় থাকে, আর আমি কোনো ডাকাতির সিনেমা চাই না। যদি কোনো ব্যবস্থাকে বুঝিয়ে তার ভদ্রতা ত্যাগ করানো যায়, তবে নির্ভরযোগ্যতা শুধু সত্যের উপর নির্ভর করে না; বরং তা নির্ভর করে রক্ষাকবচটি একটি চক্রাকার পথ নাকি একটি স্পষ্ট পোস্টারের উপর।

প্রশিক্ষণের অবশিষ্ট অংশ, পুরনো জ্ঞান, এবং কেন গ্রাউন্ডিং কোনো জাদুর কাঠি নয়

জেনারেটিভ মডেলগুলোকে একটি হিপের উপর প্রশিক্ষণ দেওয়া হয়, তারপর সেগুলোকে আপনার মঙ্গলবারের দিকে নির্দেশ করা হয়। রিট্রিভাল হলো সেই হিপের উপর বর্তমানকে গেঁথে ফেলার এক পরিণত প্রচেষ্টা। গ্রাউন্ডিং-এর অর্থ হলো "কুয়াশা থেকে নয়, বরং বর্তমান থেকে উত্তর দাও"। যখন এটি ব্যর্থ হয়, তখন তা বিনয়ের সাথেই ব্যর্থ হয়।.

চিরাচরিত ব্যর্থতা: ডেটা পুনরুদ্ধারকারী এমন একটি ডকুমেন্ট খুঁজে পায় যা প্রায় সঠিক নয়। জেনারেটর সম্পূর্ণ স্থিরতার সাথে সেটির ওপর দিয়ে লিখে যায়। আপনি একটি সোর্স-আকৃতির অবজেক্ট দেখতে পান এবং আপনার যাচাই করার সহজাত প্রবৃত্তি কাজ করা বন্ধ করে দেয়। আমি এটা করি। আপনিও সম্ভবত এটা করেন। সাইটেশনের ধারণাটি সঠিক; কিন্তু এর বাস্তবায়ন ততটাই ভালো, যতটা ভালো ফলাফল পাওয়া যায়।.

পুরনো জ্ঞান হলো আরেকটি দুর্বলতা। কিছু কাজের জন্য একটি জীবন্ত অবস্থা প্রয়োজন—যেমন দাম, মজুদ, বা কোনো নীতির বর্তমান ভাষা। আবার কিছুর জন্য একটি স্থিতিশীল পদ্ধতি প্রয়োজন, যেমন একটি মেমোর কাঠামো কেমন হবে। এই দুটিকে একসাথে মেশালে এমন একটি জগৎ সম্পর্কে খুব নিশ্চিত উত্তর পাওয়া যায়, যা ইতোমধ্যেই পরিবর্তিত হয়ে গেছে। এর পরিণত নাম হলো ডিস্ট্রিবিউশন শিফট: জীবন্ত ডিস্ট্রিবিউশন আর ট্রেনিং ডিস্ট্রিবিউশন এক নয়, এবং এই ফাঁকের মধ্যেই এজ কেসগুলো অবস্থান করে।.

আরও একটি কথা, যা ভুল জায়গায় হাইফেন দিয়ে বলা হয়েছে কারণ আমার নোটগুলো দেখতে এমনই হয়: গ্রাউন্ডিং হলো একটি মেঝে—কোনো বলয় বা আভা নয়। যদি আপনি উদ্ধার করা অংশটি পরিদর্শন করতে না পারেন, তার মানে আপনি তখনও কুয়াশার মধ্যেই আছেন, শুধু আলোটা এখন আরেকটু ভালো।.

মূল্যায়ন ক্ষেত্র: কেন একটি ডেমো একটি ভয়ানক পরীক্ষা

ডেমো হলো আলোর মতো। বেঞ্চমার্ক আরেকটু স্পষ্ট, কিন্তু সেটাও আপনার কাজ নয়।.

একটি পরিষ্কার প্রম্পট এবং এমন একটি টাস্ক যা মডেলটি এর আগেও বহুবার দেখেছে — তাই এটি দেখতে অবশ্যই চমৎকার লাগবে। যে মূল্যায়ন শুধু সেটিকেই পরিমাপ করে, তা আসলে একটি মঞ্চ নাটক পরিমাপ করার মতোই। লাইভ ওয়ার্কফ্লোতে থাকে জট পাকানো পেস্ট, হারিয়ে যাওয়া ফাইল, এবং এমন একজন ব্যবহারকারী যিনি তার উদ্বেগ কমানোর জন্য প্রথম উত্তরটিই গ্রহণ করে নেন।.

বেঞ্চমার্ক গুরুত্বপূর্ণ। কিন্তু প্রেজেন্টেশন যতটা দাবি করে, এগুলো ততটা কার্যকর নয়। লিডারবোর্ডের স্কোর আপনার টিকিটের ক্যালিব্রেশন নয়। একটি কোম্পানিতে মডেল ঝুঁকি হলো "ব্যাপক পরিমাণে ভুল হলে কী ঘটবে", "এটি কি সাধারণ জ্ঞান পরীক্ষায় উত্তীর্ণ হলো" তা নয়। আপনার প্রয়োজনীয় পরীক্ষাগুলো হবে নীরস: সংগৃহীত অনুচ্ছেদের মধ্যেই থাকুন; ভান করার পরিবর্তে অনিশ্চয়তা চিহ্নিত করুন; যখন আপনি বাক্য পুনর্গঠন করবেন তখন সামঞ্জস্যপূর্ণ থাকুন; খোলাখুলিভাবে ব্যর্থ হওয়ার (মনগড়া কথা বলার) পরিবর্তে, গোপনে ব্যর্থ হন (অস্বীকার করুন, জিজ্ঞাসা করুন, স্থগিত করুন)।.

আমি দেখেছি, লোকেরা একটিমাত্র চিত্তাকর্ষক সমাপ্তিকেই প্রমাণ হিসেবে ধরে নেয়। এটা অনেকটা এমন যে, শুধু স্টার্টারটি দেখতে সুন্দর ছিল বলেই একটি রেস্তোরাঁকে 'নির্ভরযোগ্য' বলে ধরে নেওয়া। হয়তো তা নির্ভরযোগ্যই। হয়তো রান্নাঘরটি যথেষ্ট ভালো দশ মিনিট সময় পেয়েছিল।.

এখানে একটি সামান্য স্ববিরোধিতা রয়েছে: আমি এখনও ধারণা পাওয়ার জন্য ডেমো ব্যবহার করি। কিন্তু আমি শুধু সেই ধারণার ওপর ভিত্তি করে কাউকে নিয়োগ দিই না।.

এআই কি নির্ভরযোগ্য? কেবল তখনই, যদি কেউ তখনও দায়বদ্ধ থাকে।

হিউম্যান-ইন-দ্য-লুপ হলো একমাত্র ডিজাইন যা ব্যর্থতার ধরণগুলোর সাথে সামঞ্জস্যপূর্ণ।

যদি কেউ জবাবদিহি না করে, তবে সিস্টেমটি এমনভাবে ব্যবহৃত হবে যেন তা করা হয়েছে। সুশাসন হলো ‘কে পর্যালোচনা করে, কে তা থামাতে পারে, কী নথিভুক্ত হয়, কোনো ভুলের পর কী ঘটে’—এই বিষয়গুলোর একটি সাদামাটা নাম। এজেন্টরা এই বিষয়টিকে আরও স্পষ্ট করে তোলে, কারণ তারা শুধু অনুচ্ছেদ লেখে না, বরং কাজ করে। যে খসড়াটি আপনি পাঠাননি, তা সস্তা। কিন্তু যে টুল কলটি আপনি করতে চাননি, তা সস্তা নয়।

দায়বদ্ধ ব্যক্তির নাম বলুন। যদি উত্তর হয় "মডেল", তাহলে আপনার কাছে কোনো উত্তর নেই। ঘটনার পর মডেলরা মিটিংয়ে যায় না। একজন ব্যক্তি যায়, অথবা একটি ভ্যাকুয়াম যায় এবং তারপর একজন আইনজীবী।.

বিস্ফোরণের ব্যাসার্ধের সাথে মেলে এমন যাচাইগুলো বেছে নিন। একটি সোশ্যাল পোস্টের জন্য বানান-পরীক্ষার মতো পর্যালোচনা। কোনো সত্য দাবি করা যেকোনো কিছুর জন্য উৎস যাচাই। চিকিৎসা, আইন, ঋণ, নিরাপত্তামূলক গুরুত্বপূর্ণ কার্যক্রমের সাথে সম্পর্কিত যেকোনো কিছুর জন্য একজন পেশাদার। এসবের ক্ষেত্রে, মানুষ "সবকিছুর মধ্যে থাকে না"। মানুষ নিজেই সেই চক্র। মডেলটি একটি অসম্পূর্ণ খসড়া মাত্র। এটা ব্যক্তিত্বের সংশয়বাদ নয়। এটা রুচি।

আজকালকার চল হলো একটা চকচকে ‘সেন্ড’ বাটনের আড়ালে যাচাইটা লুকিয়ে রাখা। আজকাল এভাবেই অজান্তেই একটা গুজবকে স্বয়ংক্রিয় করে ফেলা হয়। ইদানীং আমি এই ব্যাপারে আরও সংযত হয়েছি, আর তাতে কাজের মানও ভালো হয়েছে।.

কীভাবে জিজ্ঞাসা করলে ভুলটা ধরা পড়বে

সূর্যালোকের পেশাদার সন্দেহবাদী না হয়েও আপনি এই ব্যবস্থাগুলোকে প্রশ্নবিদ্ধ করতে পারেন।.

  • ইচ্ছাকৃতভাবে অনিশ্চয়তার কথা বলুন। “এটিকে আত্মবিশ্বাসী করুন” বলার চেয়ে “কীসে এটা ভুল হতে পারে?”—এই প্রশ্নটি বেশি যুক্তিযুক্ত।.

  • সম্ভব হলে ডেটা তৈরি এবং পুনরুদ্ধারের কাজ আলাদা করুন। প্রথমে অনুচ্ছেদগুলো দেখুন। তারপর লিখিত বিবরণের জন্য অনুরোধ করুন।.

  • পোশাকটা বদলান। গুছিয়ে বলুন। একে বিপরীত যুক্তি দিতে বলুন। প্রম্পট সংবেদনশীলতা একটা টর্চলাইটের মতো, যদি আপনি সেভাবে ব্যবহার করেন।.

  • বাধ্যতামূলক সীমাবদ্ধতা: "শুধুমাত্র আমার পেস্ট করা টেক্সট থেকে", "কিছু না থাকলে, অনুপস্থিত দেখাও"। মডেলগুলো আশ্চর্যজনকভাবে এটা মেনে চলে... যতক্ষণ না তারা অবাধ্য হয়। তবুও যাচাই করে দেখুন।.

  • যাচাইকারী আছে এমন কাজকে অগ্রাধিকার দিন। কম্পাইলার, লিন্টার, স্কিমা চেক—এগুলো হলো দ্বিতীয় কোনো ব্যক্তির পর্যবেক্ষণ। নির্ভরযোগ্যতা একজন মূল্যায়নকারীকে খুব পছন্দ করে।.

  • লক্ষণটির দিকে খেয়াল রাখুন: অতিরিক্ত সুনির্দিষ্টতা। একটি নিখুঁত দেখতে সংখ্যা, একটি নামযুক্ত ঘটনা, একটি পরিপাটি সংখ্যাযুক্ত ধারা — এইসব জায়গাতেই হ্যালুসিনেশন সাজতে ভালোবাসে।.

  • মানুষের হাঁটার ধাপটি দৃশ্যমান রাখুন। ইউজার ইন্টারফেস (UI) যদি চেকের ধাপটি লুকিয়ে রাখে, তাহলে মানুষ চেকটি এড়িয়ে যায়। এটা আসবাবপত্রের মতো, কোনো নৈতিক ব্যর্থতা নয়।.

এর কোনোটিই মডেলটিকে 'সত্য' প্রমাণ করে না। এটি লুপটিকে কম সরল বিশ্বাসী করে তোলে। আর আমার ধারণা, এটাই হলো এর ফল।.

মানচিত্র আপনাকে যেখানে নিয়ে যায়

সুতরাং, হ্যাঁ/না প্রশ্নটি কেবল একটি প্রবেশদ্বার হিসেবে কাজ করে।.

এআই কি নির্ভরযোগ্য? একটি বৈশিষ্ট্য হিসেবে নয়। বরং একটি কাজ, একটি ডেটাসেট, একটি ডেটা পুনরুদ্ধার প্রক্রিয়া, একটি মূল্যায়ন যা কোনো ডেমো নয়, এবং এমন একজন মানুষের গুণ হিসেবে, যাকে তার কথার মর্ম বুঝতে হয়। সাবলীলতা আমাদের বোকা বানাতেই থাকবে, কারণ আমরা ভাষা-প্রাণী এবং এই সিস্টেমগুলো হলো ভাষার যন্ত্র। আপটাইম সত্যের সাথে গুলিয়ে যেতেই থাকবে, কারণ দুটোতেই মনে হয় "কাজটা হয়েছে"। কো-পাইলটরা এই জট পাকানো মধ্যবর্তী অবস্থা—যেমন খসড়া, দ্রুত চোখ বুলিয়ে নেওয়ার মতো সারাংশ, এবং কম্পাইল করার মতো কোড—এর মধ্যেই তাদের উপযোগিতা প্রমাণ করতে থাকবে; এবং যখন আমরা বিচার-বিবেচনার ভার এমন একটি অনুচ্ছেদের উপর ছেড়ে দিই যার কোনো পরোয়া নেই, তখন তারা অনিরাপদ হয়ে ওঠে।.

যেখানে ভুল করলে খরচ কম হয় বা তা ধরা সম্ভব, সেখানে এগুলো ব্যবহার করুন। যেখানে ভুল করলে খরচ বেড়ে যায়, সেখানে গতি কমিয়ে দিন। এটাই সোজাসাপ্টা উত্তর, এবং এর মূল্য শুধু একটি স্লোগানের চেয়েও বেশি।.

একটা জিনিস মনে রাখবেন: মডেলটি নিশ্চিত কিনা, তা তাকে জিজ্ঞেস করা বন্ধ করুন। দেখুন, যখন আপনি তাকে জিজ্ঞেস করবেন যে তার ভুলটা কীভাবে হতে পারে, তখন কী ঘটে। তারপর গিয়ে যাচাই করুন।.

বাস্তব উদাহরণ: সদস্যপদ-নীতি বিষয়ক একটি এআই সহকারী তৈরি করা

দৃশ্যকল্প

প্রিয়া হারবার মেম্বারশিপের জন্য জ্ঞান কার্যক্রম পরিচালনা করেন, যা স্বাধীন জিমগুলোর জন্য যুক্তরাজ্যের একটি ৭০ সদস্যের বাণিজ্য সংস্থা। তিনজন সদস্য তাদের প্রশ্নের উত্তর দেন। তথ্যের নির্ভরযোগ্য উৎস হলো একটি ১৮০ পৃষ্ঠার হ্যান্ডবুক, যা প্রতি তিন মাস অন্তর হালনাগাদ করা হয়, এবং একটি শেয়ার্ড ড্রাইভে থাকা পুরোনো পিডিএফ ফাইলগুলো, যেগুলো মুছে ফেলার মতো মানসিক শক্তি কারও নেই।.

নেতৃত্ব ইতিমধ্যেই একটি হেল্পডেস্ক কো-পাইলট কিনেছে। ডেমোটি বেশ সুন্দর ছিল। আপটাইম ঠিকঠাকই ছিল। দ্বিতীয় সপ্তাহে, একটি সাবলীল খসড়া একজন সদস্যকে জানায় যে তিনি ১৪ দিনের জন্য পরিষেবাটি ফ্রিজ করে রাখলে 'সাধারণ নিয়ম অনুযায়ী' সম্পূর্ণ টাকা ফেরত পাবেন। কিন্তু নীতিমালায় এমনটা নেই। এজেন্ট বিষয়টি ধরে ফেলেন, কারণ টাকার ব্যাপার এলে তারা এখনও হ্যান্ডবুকটি খুলে দেখেন। নেতৃত্বের প্রশ্নটি, যা হ্যাঁ বা না-এর মতো করে পাঠানো হয়েছে, তা হলো: এআই কি নির্ভরযোগ্য?

প্রিয়া রায়টি প্রত্যাখ্যান করে। সে এটিকে একটি মানচিত্র হিসেবে গণ্য করে। কাজটি "সদস্যদের দৈববাণী দেওয়া" নয়। বরং কাজটি হলো "বর্তমান হ্যান্ডবুক থেকে একটি উত্তরের খসড়া তৈরি করা, অনুচ্ছেদটি দেখানো, এবং অনুচ্ছেদটি অনুপস্থিত থাকলে বিষয়টি বাতিল করে দেওয়া"। যদি কো-পাইলট তা করতে না পারে, তবে এটি খসড়া তৈরির একটি খেলনা, নীতি নির্ধারণের ডেস্ক নয়।.

সহকারীর যা প্রয়োজন

  • একমাত্র অনুমোদিত সংকলন হিসেবে এপ্রিল ২০২৬-এর হ্যান্ডবুক, যেখানে অধ্যায় নম্বরগুলো অক্ষত থাকবে।

  • পুরোনো ২০২৩ সালের পিডিএফটি ইচ্ছাকৃতভাবে ড্রাইভে রেখে দেওয়া হয়েছে, যাতে তারা দেখতে পারে যে পুনরুদ্ধারের সময় অল্পের জন্য হাতছাড়া হওয়া বিষয়টি ধরা পড়ে কি না।

  • লিখিত নিয়ম: গ্রাহক-সংক্রান্ত টুলগুলিতে গ্রাহকের ব্যক্তিগত তথ্য ব্যবহার করা যাবে না; মানুষের হস্তক্ষেপ ছাড়া পাঠানো যাবে না; মনগড়া সংখ্যা, উইন্ডো বা "প্রমিত" শর্ত ব্যবহার করা যাবে না।

  • প্রম্পট, পুনরুদ্ধার করা অংশ এবং চূড়ান্ত প্রেরণ লগ করার অনুমতি

  • একজন নামধারী মালিক (প্রিয়া), যিনি একটি টেস্ট সেট মূল্যায়ন করবেন এবং ব্যর্থ হলে কো-পাইলটকে থামিয়ে দেবেন, টাকার প্রশ্নে একটি মুদ্রা নিক্ষেপের চেয়েও খারাপভাবে শেষ করেছেন।

  • যদি টুলটি পুনরুদ্ধার সমর্থন করে, তবে পুনরুদ্ধার করা অংশটি অবশ্যই খসড়াটির পাশে দৃশ্যমান থাকতে হবে। যদি তা না থাকে, তবে তারা অংশটি হাতে করে জুড়ে দেবে। পরিদর্শনযোগ্য পথবিহীন গ্রাউন্ডিংও এক প্রকার ধোঁয়াশা।.

উদাহরণ নির্দেশাবলী

প্রিয়া এই কথাটা সাধারণ ভাষায় বলছে, কোনো মঞ্চনাটকের নির্দেশনার ঢঙে নয়:

আপনাকে দেওয়া এপ্রিল ২০২৬ হ্যান্ডবুকের অংশগুলো থেকেই কেবল উত্তর দিন। সেকশন নম্বর উল্লেখ করুন। যদি উত্তরটি সেই অংশগুলোতে না থাকে, তবে বলুন "বর্তমান হ্যান্ডবুকে নেই" এবং থেমে যান। ফ্রিজ উইন্ডো, রিফান্ডের নিয়ম বা ফি সম্পর্কে মনগড়া কিছু বলবেন না। "জিমের বিবেচনার ভিত্তিতে" কথাটিকে "সাধারণ নিয়ম" হিসেবে উল্লেখ করবেন না। যদি দুটি অংশের মধ্যে বিরোধ দেখা দেয়, তবে দুটিই দেখান এবং বলুন কোনটি বর্তমান। আপনি এমন একজন মানুষের জন্য খসড়া তৈরি করছেন যিনি কোনো সদস্যের কাছে কিছু যাওয়ার আগে সোর্স কোড উন্মুক্ত করবেন।.

তারপর সে নিজের জন্য দ্বিতীয় একটি নির্দেশনা রেখে দেয়, কারণ প্রবন্ধটির মূল বিষয় হলো চক্রটি, মডেলটি নয়:

পাঠানোর আগে, উদ্ধৃত অংশটি খুলুন। নিজেকে জিজ্ঞাসা করুন, "কী কারণে এটি ভুল হতে পারে?" যদি খসড়াটিতে এমন কোনো সংখ্যা থাকে যা মূল অংশে নেই, তবে তা বাতিল করুন। যদি আপনি তাড়াহুড়ো করে কোনো বসের মতো প্রশ্ন করে থাকেন, তবে এবার একজন সংশয়বাদীর মতো আবার জিজ্ঞাসা করুন এবং তুলনা করে দেখুন।.

একটি ভালো খসড়া দেখতে এইরকম: "বর্তমান হ্যান্ডবুকে (এপ্রিল ২০২৬, ধারা ৪.২) নেই। সদস্যপদ স্থগিত করার বিষয়টি জিমের বিবেচনার উপর নির্ভরশীল। অর্থ ফেরত স্বয়ংক্রিয় নয়। বিষয়টি ঊর্ধ্বতন কর্তৃপক্ষের কাছে জানান।" একটি খারাপ খসড়া দেখতে এইরকম: "সদস্যরা ১৪ দিনের জন্য সদস্যপদ স্থগিত করতে পারেন এবং নিয়ম অনুযায়ী সম্পূর্ণ অর্থ ফেরত পাবেন। হ্যান্ডবুকে এটি নিশ্চিত করা হয়েছে।" সুর একই। এই দুটির মধ্যে কেবল একটিই নীতিমালা।.

কীভাবে এটি পরীক্ষা করবেন

প্রিয়া কোনো কো-পাইলট আউটপুট দেখার আগেই ২০টি প্রশ্ন লিখে নেয়। এই ক্রমটা গুরুত্বপূর্ণ। একটি ডেমো হলো লাইটিং। এটি হলো ড্রাই টেস্ট।.

সেটটি কোনো সাধারণ বিষয় নয়। এটি হলো লাইভ ডেস্ক:

  • আটটি প্রশ্ন, যেগুলোর উত্তর একটি বর্তমান বিভাগে রয়েছে (সহজ প্রশ্নগুলো)।

  • চারটি অল্পের জন্য অমিল, যেখানে ২০২৩ সালের পিডিএফটি এপ্রিল মাসের পাঠ্যের চেয়ে শব্দচয়নে বেশি কাছাকাছি।

  • হ্যান্ডবুকে নেই এমন তিনটি প্রশ্ন (বিলিং সংক্রান্ত বিরোধ, চিকিৎসা-সংলগ্ন "এই প্রশিক্ষণটি নিরাপদ কিনা", এবং আইন-সংলগ্ন চুক্তির একটি সামান্য পরিবর্তন)

  • অর্থ সংক্রান্ত তিনটি প্রশ্ন (স্থগিতকরণ, ফেরত, যোগদান ফি)

  • সদস্যদের দুটি সাধারণ প্রশ্ন (খোলার সময়, প্রশিক্ষকের বীমা)

প্রম্পট-সংবেদনশীলতা যাচাই করার জন্য, ঐ কুড়িজনের মধ্যে দুজনকে দ্বিতীয় একটি পোশাকে পুনরায় জিজ্ঞাসা করা হয়েছিল—একবার একজন তাড়াহুড়ো করা বস হিসেবে এবং আরেকবার একজন সংশয়বাদী হিসেবে। এই পুনঃজিজ্ঞাসাগুলো নথিভুক্ত করা হয়েছিল, কিন্তু ২০-আইটেমের স্কোরের মধ্যে অন্তর্ভুক্ত করা হয়নি।.

হ্যান্ডবুকটি খোলা রেখে প্রিয়ার দেওয়া মূল্যায়ন নির্দেশিকা: পাস করার জন্য সঠিক বর্তমান নিয়ম, একটি আসল সেকশন নম্বর এবং কোনো অতিরিক্ত মনগড়া ক্লজ থাকা চলবে না। একটি ‘কোয়ায়েট ফেল’ হলো এমন একটি বাক্য যা প্রযুক্তিগতভাবে ঠিক থাকা সত্ত্বেও ব্যতিক্রমটি বাদ দিয়েছে অথবা কোনো ‘হতে পারে’-কে ‘অবশ্যই’ করে তুলেছে। একটি ‘ওপেন ফেল’ হলো একটি মনগড়া নম্বর অথবা অল্পের জন্য পাশ করা একটি পিডিএফ ফাইলকে বর্তমান হিসেবে গণ্য করা। আপটাইম আলাদাভাবে গণনা করা হয়, কারণ “এটি উত্তর দিয়েছে” আর “এমনটাই ছিল” এক নয়।.

আরও অগ্রসর হওয়ার জন্য সম্মতি: টাকার প্রশ্নে, খোলাখুলিভাবে ব্যর্থ হওয়ার চেয়ে বিষয়টি গোপন রাখাই শ্রেয়। যদি কো-পাইলট টাকা ফেরতের একটি সুযোগ তৈরি করে, তবে সে লাইভ টিকিট তৈরি করে না। যদি কেউ সোর্স কোড খুলতে রাজি না হয়, তবে সে লাইভ টিকিট তৈরি করে না।.

ফলাফল

এটি একটি মনগড়া ২০টি প্রশ্নের পরীক্ষা থেকে প্রাপ্ত দৃষ্টান্তমূলক ফলাফল, কোনো প্রকাশিত হারবার সদস্য সংখ্যার পরিসংখ্যান নয়।.

অনুমানসমূহ: একজন হেল্পডেস্ক কো-পাইলট; এপ্রিল ২০২৬ হ্যান্ডবুক এবং ২০২৩-এর অবশিষ্ট পিডিএফ; প্রিয়াকে উপরের রুব্রিক অনুযায়ী স্কোর দেওয়া হয়েছে; "আমি এটি পাঠাব" অংশে প্রশ্ন পেস্ট করে ফোনের স্টপওয়াচ দিয়ে সময় গণনা করা হয়েছে; পর্যালোচনার সময় ইচ্ছাকৃতভাবে লুপ করা অবস্থায় অন্তর্ভুক্ত এবং যাচাই না করা অবস্থায় বাদ দেওয়া হয়েছে, যাতে তুলনাটি সমান থাকে।.

যাচাইবিহীন কো-পাইলট, ডেমো-স্টাইলের প্রম্পট: ২০টি প্রশ্নের মধ্যে ২০টিতেই সাবলীল উত্তর পাওয়া গেছে (আপটাইম নিখুঁত ছিল)। ২০টির মধ্যে ১১টি নির্ধারিত মানদণ্ড পূরণ করেছে। পাঁচটি নীরবে ব্যর্থ হয়েছে। ১৪ দিনের জন্য স্থগিত থাকাসহ চারটি প্রকাশ্য ব্যর্থতা ছিল। এই চারটি প্রকাশ্য ব্যর্থতার মধ্যে দুটিতে ২০২৩ সালের পিডিএফ থেকে একটি উৎস-আকৃতির অংশ উল্লেখ করা হয়েছিল। প্রেরণের যোগ্য একটি খসড়া তৈরি করতে গড় সময় লেগেছে ১ মিনিট।.

একই ২০টি প্রশ্ন, সীমিত নির্দেশনা, সংগৃহীত অংশ দৃশ্যমান: এপ্রিল মাসের পাঠ্য থেকে ২০টির মধ্যে ১৫টি সম্পূর্ণ সঠিক ছিল। তিনজন সঠিকভাবে বলেছেন যে এগুলো "বর্তমান হ্যান্ডবুকে নেই" (চিকিৎসা-সংলগ্ন ও আইন-সংলগ্ন বিষয়গুলো, এবং একটি বিলিং সংক্রান্ত বিরোধ), তাই ২০টির মধ্যে ১৮টি গ্রহণযোগ্য ছিল। দুজন এখনও ব্যর্থ হয়েছেন: একজন প্রায়-ভুল হওয়া ২০২৩ সালের পিডিএফটি উপেক্ষা করে লিখেছেন, এবং অন্যজন যোগদান-ফি-এর এমন একটি অঙ্ক বানিয়ে লিখেছেন যা পাঠ্যাংশে ছিল না। খসড়া তৈরিতে গড় সময় ছিল প্রায় ১ মিনিট।.

সেই একই ২০, সাথে প্রিয়া একটি সিমুলেটেড পাঠানোর আগে উল্লিখিত অংশটি খুলেছিল: ২০টির মধ্যে ১৯টি গ্রহণযোগ্য হতো। সে অল্পের জন্য বাদ পড়া পিডিএফটি ধরে ফেলেছিল। বাকি একটি ভুল ছিল পর্যালোচকের একটি সাবলীল অনুচ্ছেদ দ্রুত চোখ বুলিয়ে যাওয়া এবং মনগড়া যোগদান-ফি-এর অঙ্কটি খেয়াল না করা। পর্যালোচনা সহ গড় সময় ছিল ৩ মিনিট।.

পুরানো পদ্ধতি, শুধু হ্যান্ডবুক অনুসন্ধান, কোনো সহ-পাইলট নেই: ২০টির মধ্যে ২০টিই গ্রহণযোগ্য। মধ্যক ৯ মিনিট।.

এই নমুনায়, লুপড কো-পাইলট হ্যান্ডবুক হান্টের চেয়ে ৬ মিনিট দ্রুত ছিল (৯ বিয়োগ ৩), অর্থাৎ ২০টি প্রশ্নে ১২০ মিনিট, যেখানে ২০টির মধ্যে ২০টিই গ্রহণযোগ্য হওয়ার পরিবর্তে ২০টির মধ্যে ১৯টি গ্রহণযোগ্য ছিল। আনচেকড কো-পাইলট ৮ মিনিট দ্রুত ছিল (৯ বিয়োগ ১) এবং নীরবে বা সশব্দে ২০টির মধ্যে ৯টিতেই ভুল করেছিল। এটি স্টিয়ারিং প্যাকে থাকা ৬৭% সময় সাশ্রয় নয়। এটি ৯টি ভুলের একটি সুযোগ যা আপনি স্বয়ংক্রিয় করে ফেলতেন।.

পুনরাবৃত্ত দুটি প্রশ্নের তাড়াহুড়ো করে করা কর্তৃত্বপূর্ণ সংস্করণ দুটিই অতিরঞ্জিত দাবি করেছিল। সংশয়বাদী সংস্করণগুলো বিষয়টি এড়িয়ে গিয়েছিল। একই মডেল, একই হ্যান্ডবুক, শুধু পোশাকটা আলাদা। প্রিয়া বিষয়টিকে একটি পর্যবেক্ষণ হিসেবে নথিভুক্ত করেছিল, কোনো ব্যক্তিত্ব হিসেবে নয়।.

এই পরিসংখ্যানগুলো উল্লিখিত পরীক্ষা, একটি ছোট সেট, একজন ক্রুদ্ধ সদস্যের চেয়েও সহজ কিছু টিকিট এবং এমন একজন পর্যালোচকের উপর ভিত্তি করে তৈরি একটি আনুমানিক উদাহরণ, যিনি আগে থেকেই সবকিছু জানতেন। এগুলো এটা প্রমাণ করে না যে কো-পাইলট "৯৫% নির্ভরযোগ্য", বা হারবারের একজন ডেস্ক কর্মীকে ছাঁটাই করা উচিত। এগুলো শুধু এটাই দেখায় যে, আপটাইম মূল প্রশ্ন ছিল না, বরং মূল প্রশ্ন ছিল যাচাইকরণ প্রক্রিয়াটি।.

কী ভুল হতে পারে

  • নেতৃত্ব ১-মিনিটের ড্রাফট সময়ের কথা উল্লেখ করে এবং ৯টি ব্যর্থতার কথা এড়িয়ে যায়। বিকেল ৪টায়ও গতিকে যোগ্যতার পরিচায়ক বলেই মনে হয়।.

  • ২০২৩ সালের পিডিএফটি ইনডেক্সে থেকে যায়। রিট্রিভাল করলে এটি ঠিকই চলে আসে। গ্রাউন্ডিং এখন বেশ পরিণত মনে হচ্ছে, কিন্তু তাও অল্পের জন্য রক্ষা।.

  • ইউআই সংগৃহীত অংশটিকে একটি চকচকে 'প্রেরণ' বোতামের আড়ালে লুকিয়ে রাখে। লোকেরা হ্যান্ডবুকটি খোলা বন্ধ করে দেয়, আর এভাবেই 'স্থগিতকরণ' সংক্রান্ত উত্তরটি কোনো সদস্যের কাছে পৌঁছায়।.

  • প্রিয়া শুধু আটটি সহজ প্রশ্নেরই নম্বর দেয়, কারণ স্লাইডে ওগুলো দেখতে সুন্দর লাগে। এ যেন এক মূল্যায়ন নাটক, শুধু স্প্রেডশিট দিয়ে করা।.

  • চিকিৎসা-সংলগ্ন ‘এই প্রশিক্ষণটি নিরাপদ কি না’—এই ধরনের উত্তরকে সংক্ষিপ্ত বলে মনে হতে পারে। মানচিত্রে বলা ছিল প্রায় কখনোই না। কিন্তু বলার ভঙ্গি ছিল এগিয়ে যাওয়ার পক্ষে।.

  • লগগুলো বন্ধ করে দেওয়া হয়েছে কারণ 'এটা বাড়তি মনে হচ্ছিল'। একটি ভুলের পর, কোন প্যাসেজটি উদ্ধার করা হয়েছে তা কেউ দেখতে পায় না।.

  • তারা মডেলটিকে জিজ্ঞাসা করে সে নিশ্চিত কিনা। সে নিশ্চিতই থাকে। পরীক্ষাটা কখনোই তা ছিল না।.

ব্যবহারিক শিক্ষা

হারবার যে কো-পাইলটকে কিনেছিলেন, নির্ভরযোগ্যতা তার কোনো বৈশিষ্ট্য নয়। এটি হলো ২০টি প্রশ্ন, একটি হালনাগাদ হ্যান্ডবুক, একটি দৃশ্যমান অনুচ্ছেদ এবং এমন একজন ব্যক্তির গুণ, যিনি অর্থের লেনদেন জড়িত থাকলেও উৎস উন্মুক্ত রাখেন। সাবলীলতা আপটাইম পরীক্ষায় উত্তীর্ণ হতেই থাকবে। একমাত্র লুপই পলিসি পরীক্ষায় উত্তীর্ণ হয়।.

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

জেনারেটিভ এআই-এর ক্ষেত্রে নির্ভরযোগ্য বলতে আসলে কী বোঝায়?

দৈনন্দিন নির্ভরযোগ্যতার অর্থ হলো কোনো কিছুর ওপর নির্ভর করা। স্বয়ংসম্পূর্ণ অটোমেশনের ক্ষেত্রে, একটি মাত্র শব্দের আড়ালে একগুচ্ছ বৈশিষ্ট্য লুকিয়ে থাকে: বাস্তবতা, ধারাবাহিকতা, ক্রমাঙ্কন, নিরাপত্তা, কার্যক্ষমতা, তাৎক্ষণিক সংবেদনশীলতা, বিশেষ পরিস্থিতি এবং বন্টন পরিবর্তনের পরের আচরণ। এগুলোর কোনোটিই একসাথে ব্যর্থ হয় না। লাইভ টেস্টটি কিসের জন্য, কার জন্য এবং এর চারপাশের লুপের সাথে নির্ভরযোগ্য। অন্যথায়, আপনি একটি ব্লেন্ডারকে এই ভিত্তিতে নম্বর দিচ্ছেন যে এটি ট্যাক্স করতে পারে কি না।.

কৃত্রিম বুদ্ধিমত্তা কি নির্ভরযোগ্য?

বৈশিষ্ট্য হিসেবে নয়। একজন এলএলএম (LLM) এক কাজে অত্যন্ত নির্ভরযোগ্য হতে পারেন, আবার পরের কাজেই নীরবে খাপছাড়া হয়ে যেতে পারেন; কখনও একই সময়ে, আবার কখনও শুধু একটি কমা সরানোর কারণেও এমনটা হতে পারে। নির্ভরযোগ্যতা হলো একটি কাজ, একটি ডেটাসেট, একটি ডেটা পুনরুদ্ধার প্রক্রিয়া, একটি ডেমো নয় এমন মূল্যায়ন এবং একজন মানুষের বৈশিষ্ট্য, যাকে তার কথা মন থেকে বলতে হয়। যেখানে সামান্য ভুলও কম খরচে বা সহজে ধরা যায়, সেখানে এটি ব্যবহার করুন। যেখানে ভুল ব্যয়বহুল, সেখানে কাজের গতি কমিয়ে দিন।.

এআই আপটাইম কি সত্যনিষ্ঠার সমান?

না। আপটাইম হলো এন্ডপয়েন্টটি সাড়া দিয়েছে কি না। আর সত্যতা হলো উত্তরটি সঠিক ছিল কি না। আপনার এমন একটি পরিষেবা থাকতে পারে যা কখনও সমস্যা করে না, অথচ আপনি গ্রাহকের টিকেটে একটি সাবলীল মিথ্যা পাঠিয়ে দিতে পারেন। যখন অপেক্ষমাণ তালিকাটি বিশাল হয়, তখন গতিকেই দক্ষতা বলে মনে হয়। নিরাপত্তা হলো আরও একটি দিক: যে মডেলটি জেলব্রেক করতে অস্বীকার করে, সেটিও হয়তো আপনার নিজের নোটের সারাংশকেই বিকৃত করে ফেলতে পারে।.

সাবলীল এআই ভুল করার পরেও কেন বিশ্বাসযোগ্য মনে হয়?

নির্ভুলতা আর সাবলীলতার মধ্যে বিচ্ছেদ ঘটল, এবং শেষ পর্যন্ত সাবলীলতাই জয়ী হলো। একজন এলএলএম আপনাকে ছন্দ, কৌশলী ইঙ্গিত, হয়তো একটি নকল কিন্তু সুন্দর উদ্ধৃতির কাঠামো দেবে, আর আপনার মস্তিষ্ক বুঝে নেবে, "এই ব্যক্তি সব জানে।" সমন্বয় প্রায়শই ভয়াবহ হয়: উচ্চ আত্মবিশ্বাস, মাঝারি মানের সত্য, যা পরিবেশন করা হয় মূল বক্তৃতার মতো করে। একটি আনাড়ি ভুল উত্তর আপনাকে সন্দিহান করে তোলে। একটি সাবলীল ভুল উত্তর আপনাকে যাচাই করা থেকে বিরত রাখে। যদি কোনো বক্তব্য সংক্ষিপ্তসারের মতো শোনায়, আমরা সেটিকে সংক্ষিপ্তসার হিসেবেই গণ্য করি, আর এভাবেই ভুলটি ডেকের মধ্যে ঢুকে যায়।.

চিকিৎসা, আইন বা গ্রাহক-সহায়তা কাজের জন্য এআই কি নির্ভরযোগ্য?

এটা কাজের উপর নির্ভর করে, ব্র্যান্ডের উপর নয়। চিকিৎসা ও আইন-সংলগ্ন পরামর্শ একটি পণ্য হিসেবে প্রায় কখনোই যথেষ্ট ভালো হয় না: এক্ষেত্রে মডেলটি একটি অসম্পূর্ণ খসড়া মাত্র এবং মানুষটিই হলো পেশাদার। গ্রাহক পরিষেবা একটি কঠোর নীতিমালার অধীনে খসড়া তৈরি করতে পারে, কিন্তু অর্থ ও বিশ্বাসের দায়িত্ব একজন ব্যক্তিরই নেওয়া উচিত, কারণ মনগড়া নীতিমালা এবং ভদ্রভাবে ভুল 'না' বলাই হলো সাধারণ ব্যর্থতার কারণ। খসড়া এবং সারসংক্ষেপ হলো আপনার আগে থেকে জানা কোনো লেখার প্রাথমিক রূপ। নাম, নম্বর এবং যে বাক্যটি আঘাত হানতে পারে, তা যাচাই করে নিন।.

কেন এআই বিভ্রমের শিকার হয়, লক্ষ্যভ্রষ্ট হয়, বা নীরবে ভুল করে?

বিভ্রম হলো সেই মজাদার ভুল: এমন একটি বই যার কোনো অস্তিত্ব নেই, এমন একটি ফাংশন যা কখনো চালুই করা হয়নি, বা এমন একটি নীতিমালার ধারা যার সংখ্যাটি বেশ আনুষ্ঠানিক মনে হয়। বিচ্যুতি ততটা চলচ্চিত্রধর্মী নয়: পৃথিবী চলতে থাকে, মডেলের অবশিষ্ট অংশগুলো থেকে যায়, এবং আপনি পূর্ববর্তী আবহাওয়া থেকে একটি সুসংগঠিত উত্তর পেয়ে যান। নীরব ভুল হলো এমন একটি সারসংক্ষেপ যা ব্যতিক্রমটিকে বাদ দেয়। অথবা এমন একটি ভাবানুবাদ যা 'হয়তো' শব্দটিকে 'অবশ্যই'তে উন্নীত করে। তথ্যনিষ্ঠা দেখতে প্রযুক্তিগতভাবে ঠিকঠাক মনে হলেও এর অর্থটা সরে যেতে পারে। তাৎক্ষণিক সংবেদনশীলতা তথ্যগুলোকে ঝলমল করে তোলে যখন আপনি মোড়কটি বদলে দেন।.

গ্রাউন্ডিং বা পুনরুদ্ধার কি এআই-কে নির্ভরযোগ্য করে তোলে?

গ্রাউন্ডিং মানে কুয়াশা থেকে নয়, বরং বর্তমান থেকে উত্তর পাওয়া। পুনরুদ্ধার বর্তমানকে একটি প্রশিক্ষিত স্তূপে গেঁথে দেয়। যখন এটি ব্যর্থ হয়, তখন তা বিনয়ের সাথেই ব্যর্থ হয়: একটি অল্পের জন্য লক্ষ্যভ্রষ্ট নথি, একটি সুসংবদ্ধ লেখা, এবং আপনার যাচাই করার সহজাত প্রবৃত্তি বিদায় নেয়। গ্রাউন্ডিং হলো একটি ভিত্তি, কোনো জ্যোতির্বলয় নয়। আপনি যদি পুনরুদ্ধার করা অংশটি পরীক্ষা করতে না পারেন, তবে আপনি তখনও কুয়াশার মধ্যেই আছেন, শুধু আলোটা আরেকটু ভালো। মূল্য বা নীতির শব্দচয়নের মতো জীবন্ত অবস্থার কাজগুলোকে স্থিতিশীল দক্ষতার সাথে মেশান, এবং আপনি এমন একটি জগৎ সম্পর্কে খুব নিশ্চিত উত্তর পাবেন যা ইতিমধ্যেই পরিবর্তিত হয়েছে।.

কেন একটি ডেমো এআই-এর নির্ভরযোগ্যতা পরীক্ষার জন্য একটি খারাপ পদ্ধতি?

একটি পরিষ্কার প্রম্পট এবং এমন একটি টাস্ক যা মডেলটি আগে বহুবার দেখেছে, তা দেখতে চমৎকার লাগবে। লাইভ ওয়ার্কফ্লোতে থাকে জট পাকানো পেস্ট, অনুপস্থিত ফাইল এবং এমন একজন ব্যবহারকারী যিনি তার উদ্বেগ কমায় এমন প্রথম উত্তরটিই গ্রহণ করে নেন। লিডারবোর্ডের স্কোর আপনার টিকেটগুলোর ক্যালিব্রেশন নয়। মডেলের ঝুঁকি হলো, যখন এটি বিপুল পরিমাণে ভুল হয় তখন কী ঘটে, এটি কোনো সাধারণ জ্ঞান পরীক্ষায় উত্তীর্ণ হলো কি না তা নয়। আপনার প্রয়োজনীয় পরীক্ষাগুলো হবে নীরস: প্রাপ্ত অনুচ্ছেদের মধ্যেই থাকুন, ফাঁকি দেওয়ার পরিবর্তে অনিশ্চয়তা চিহ্নিত করুন, পুনর্গঠন করার সময় সামঞ্জস্যপূর্ণ থাকুন, এবং নতুন কিছু উদ্ভাবন না করে সমাধান বন্ধ করতে ব্যর্থ হোন।.

দায়বদ্ধ না থাকলে এআই কি নির্ভরযোগ্য?

না। যদি কেউ জবাবদিহি না করে, তবে সিস্টেমটি এমনভাবে ব্যবহৃত হবে যেন জবাবদিহি আছে। ‘হিউম্যান-ইন-দ্য-লুপ’ হলো একমাত্র ডিজাইন যা ব্যর্থতার ধরণগুলোর সাথে মেলে: কে পর্যালোচনা করে, কে এটি থামাতে পারে, কী নথিভুক্ত হয়, এবং কোনো ভুলের পর কী ঘটে। যদি উত্তরটি হয় "মডেল", তবে আপনার কাছে কোনো উত্তর নেই। ঘটনার পরের মিটিংয়ে মডেলরা যায় না। চিকিৎসা, আইন, ক্রেডিট বা নিরাপত্তা-সংক্রান্ত গুরুত্বপূর্ণ কার্যক্রমের ক্ষেত্রে, মানুষই হলো সেই চক্র এবং মডেল হলো একটি অসম্পূর্ণ অংশ।.

আমি কীভাবে এআই-কে নির্দেশ দেব যাতে আমি ভুলগুলো ধরতে পারি?

ইচ্ছাকৃতভাবে অনিশ্চয়তার কথা জিজ্ঞাসা করুন: "কী কারণে এটি ভুল হতে পারে?"—এই প্রশ্নটি "এটিকে আত্মবিশ্বাসী করুন" বলার চেয়ে শ্রেয়। যখন সম্ভব, তথ্য সংগ্রহ এবং তৈরি করার প্রক্রিয়াকে আলাদা করুন। প্রথমে পাঠ্যাংশগুলো দেখুন, তারপর লিখিত রূপটি চেয়ে নিন। এর রূপ পরিবর্তন করুন: বাক্যটি নতুন করে সাজান, অথবা এর বিপরীত যুক্তি দিতে বলুন। "শুধুমাত্র আমার দেওয়া লেখা থেকে" বা "কিছু না থাকলে, শুধু 'নেই' বলুন"-এর মতো সীমাবদ্ধতা আরোপ করুন এবং তারপরেও যাচাই করে নিন। যাচাইকারী আছে এমন কাজকে অগ্রাধিকার দিন এবং অতিরিক্ত সুনির্দিষ্টতার দিকে নজর রাখুন, কারণ বিভ্রম সেখানেই সাজতে পছন্দ করে।.

তথ্যসূত্র

  1. NIST - nvlpubs.nist.gov

  2. NIST - airc.nist.gov

  3. NIST - airc.nist.gov

  4. আইসিও - ico.org.uk

  5. এনসিএসসি - www.ncsc.gov.uk

  6. এনসিএসসি - www.ncsc.gov.uk

  7. OWASP - genai.owasp.org

অফিসিয়াল এআই অ্যাসিস্ট্যান্ট স্টোরে সর্বশেষ এআই খুঁজুন

আমাদের সম্পর্কে

কুইজ
১. প্রবন্ধটি অনুসারে, একটি বৈশিষ্ট্য হিসেবে এআই কি নির্ভরযোগ্য?

২. আপটাইম এবং ট্রুথফুলনেস-এর মধ্যে পার্থক্য কী?

৩. কেন একটি সাবলীল ভুল উত্তর একটি আনাড়ি উত্তরের চেয়ে বেশি বিপজ্জনক?

৪. দৃষ্টান্তমূলক হারবার মেম্বারশিপের ২০-প্রশ্নের পরীক্ষায়, অনিয়ন্ত্রিত কো-পাইলটের ক্ষেত্রে কী ঘটেছিল?

৫. প্রবন্ধটি অনুসারে, পরিদর্শনযোগ্য পুনরুদ্ধারকৃত চাঙ্ক ছাড়া গ্রাউন্ডিং বলতে কী বোঝায়?


ব্লগে ফিরে যান