ওপেনএআই তাদের নতুন জিপিটি-৬ অ্যাস্ট্রা মডেলের জন্য প্রকাশিত কিছু মূল্যায়ন মেট্রিক আবার পরিবর্তন করেছে। গত ৩ সেপ্টেম্বর বিকেলে একটি ব্লগ পোস্টে প্রথম ঘোষণার পর থেকেই এই পরিবর্তন দেখা যাচ্ছে। আপডেট করা সংস্করণে অ্যাস্ট্রার স্কোর কিছু ক্ষেত্রে আরও ভালো দেখানো হয়েছে, অন্যদিকে প্রতিদ্বন্দ্বী প্রতিষ্ঠান অ্যানথ্রপিকের মডেলগুলোর সংখ্যা আরও খারাপ হিসেবে উপস্থাপন করা হয়েছে।
ব্লগ পোস্টটি প্রকাশের প্রক্রিয়াটিও ছিল অস্বাভাবিক। পূর্ব পরিকল্পনা অনুযায়ী পোস্টটি বিকেল ২টায় প্রকাশিত হওয়ার কথা ছিল, কিন্তু তা প্রায় দুই ঘণ্টা পর অনলাইনে দেখা যায়। ওপেনএআই-এর এক্স অ্যাকাউন্ট থেকে বিকেল ৩টা ৩২ মিনিটে পোস্টটি টুইট করা হলেও লিংকটি লোড হচ্ছিল না এবং ত্রুটি বার্তা আসছিল। পরে সিইও স্যাম অল্টম্যান নিজেই বিকেল ৩টা ৫০ মিনিটে লিংকটি পোস্ট করেন এবং বলেন, 'ব্লগ পোস্টটি ডিপ্লয় করতে সামান্য সমস্যা হয়েছে, তবে এটি সত্যিই চমৎকার।' তবুও একাধিক ব্যবহারকারী একই ত্রুটি দেখতে পান। প্রায় এক ঘণ্টা পর এটি ঠিকভাবে দেখা যায়। ওপেনএআই জানায়, তারা বিকেল ২টার কিছু পরে ব্লগটি প্রকাশ করেছিল কিন্তু কিছু কারণে তা সরিয়ে নেয়, যার কারণ তারা বলতে পারেনি। তবে এটি বেঞ্চমার্কের পারফরম্যান্স সংখ্যার সঙ্গে সম্পর্কিত নয় বলে জানানো হয়। প্রথমে তারা বলেছিল এটি কনটেন্ট ম্যানেজমেন্ট সিস্টেমের ত্রুটি, পরে বলেছিল ইন্টারনেট বিভ্রাট।
পুনরায় প্রকাশের সময় ব্লগটিতে ভিন্ন মূল্যায়ন মেট্রিক ছিল যা অ্যাস্ট্রার পক্ষে ছিল বলে মনে হচ্ছে। এমনকি পরবর্তী সময়েও কিছু সংখ্যা পরিবর্তন হতে থাকে। সবচেয়ে উল্লেখযোগ্য পরিবর্তন ছিল অ্যাস্ট্রার হ্যালুসিনেশন রেট। ইন্টারনেট আর্কাইভের প্রথম স্ন্যাপশটে (বিকেল ২টা ২৩ মিনিট) এটি ছিল ৪.২%। পরবর্তী কয়েকটি স্ন্যাপশটেও একই সংখ্যা থাকে, কিন্তু পঞ্চম স্ন্যাপশটের পর (বিকেল ৩টা ১১ মিনিট) ছয় নম্বর স্ন্যাপশটে (বিকেল ৫টা ২০ মিনিট) তা কমে ২%-এ নেমে আসে। তবে বর্তমানে এটি আবার ৪.২%-এ ফিরে গেছে। একইভাবে জিপিটি-৫.৬ সোলের হ্যালুসিনেশন রেট প্রথমে ১২.২% ছিল, পরে ৯.৪% হয়, এখন আবার ১২.২%।
ওপেনএআই-এর অভ্যন্তরীণ সাইবার নিরাপত্তা বেঞ্চমার্ক এক্সপ্লয়টবেঞ্চে সোলের স্কোর ৫.৫% থেকে বাড়িয়ে ১১.৫% করা হয়েছে, কিন্তু সংস্থাটি জানায় তারা এটি পুনরায় ৫.৫%-এ ফেরানোর বিষয়ে তদন্ত করছে, কারণ ১১.৫% ফলাফল এমন একটি রিজনিং লেভেল নির্দেশ করে যা বাণিজ্যিকভাবে সোলের জন্য উপলব্ধ নয়।
অ্যাস্ট্রা গণিতে বিশেষভাবে পারদর্শী বলে দাবি করে ওপেনএআই, যা ঘোষণা পৃষ্ঠার প্রথম অনুচ্ছেদেই উল্লেখ করা হয়েছে। ফ্রন্টিয়ারম্যাথ টিয়ার ৪ (ভি২) ইভালে অ্যাস্ট্রার স্কোর ৯৭.৬% স্থির থাকে, কিন্তু সোল এবং অ্যানথ্রপিকের নতুন মডেল ফেবল ৫.১-এর স্কোর সাময়িকভাবে পরিবর্তন করা হয়। প্রথম স্ন্যাপশটে ফেবলের স্কোর ৮৭.৮% ছিল, বিকেল ৫টা ১৭ মিনিটে তা ৭৮%-এ নেমে যায়, বর্তমানে তা আবার ৮৩% হয়েছে। সোলের স্কোরও ৮৩% থেকে ৮০.৫% হয়ে আবার ৮৩% হয়েছে।
মূল প্রকাশের আগেই মেট্রিক পরিবর্তন শুরু হয়েছিল। সংবাদমাধ্যমকে দেওয়া প্রি-পাবলিকেশন ড্রাফটে অ্যাস্ট্রার ARC-AGI-3 স্কোর ৯৮.৬% দেখানো হয়েছিল, কিন্তু এখন লাইভ ব্লগে তা ৯৯.৯৯%। ওপেনএআই বলছে, প্রকাশের আগে তারা সবসময় ইভাল যাচাই করে, তাই ড্রাফট এবং চূড়ান্ত সংস্করণের মধ্যে সমন্বয় স্বাভাবিক। বেঞ্চমার্ক নির্মাতা আর্ক প্রাইজ ফাউন্ডেশন তাদের স্বাধীন মূল্যায়নে দেখেছে যে অ্যাস্ট্রা ৯৯.৯% স্কোর করেছে, তবে শুধুমাত্র বিশেষ শক্তিশালী হারনেস (যা মডেল ব্যবহার করতে পারে এমন টুলস সেট) দেওয়া হলে। স্ট্যান্ডার্ড হারনেসে স্কোর ছিল ৬৩%, যা বর্তমানে সর্বজনীনভাবে প্রকাশিত অন্যান্য মডেলের চেয়ে অনেক ভালো।
স্ট্যানফোর্ড ইন্টেলিজেন্ট সিস্টেমস ল্যাবরেটরি এবং স্ট্যানফোর্ড ট্রাস্টওয়ার্দি এআই ল্যাবের গবেষক অঙ্কা রুয়েল এবং মাইক হার্ডি বলেছেন, এই সংখ্যাগুলো নিয়ে 'বেঞ্চম্যাক্সিং' হতে পারে — এটি এআই শিল্পে পরিচিত একটি অনুশীলন, যেখানে বিভিন্ন শর্তে পুনরায় মূল্যায়ন চালিয়ে স্কোর সর্বোচ্চ করা হয়। তারা আরও উল্লেখ করেছেন যে GPT-6 Astra সিস্টেম কার্ডে অভ্যন্তরীণ হ্যালুসিনেশন বেঞ্চমার্ক সম্পর্কে প্রায় কোনো বিবরণ নেই, এমনকি পরীক্ষার আইটেম সংখ্যাও উল্লেখ নেই।
ওপেনএআই মুখপাত্র বলেন, 'আমরা সঠিকভাবে মূল্যায়ন করার বিষয়ে গভীরভাবে যত্নশীল। বেশিরভাগ মূল্যায়নে সঠিক চেকপয়েন্ট, হারনেস এবং রিপোর্টিংয়ের উপর ভিত্তি করে কয়েক শতাংশ পয়েন্টের মধ্যে নয়েজ থাকে। আমাদের লঞ্চ ব্লগে আমরা নিশ্চিত করতে সংশোধন করেছি যে সংখ্যাগুলো উপলব্ধ মডেল পারফরম্যান্সের সর্বোত্তম অনুমান উপস্থাপন করে, যাতে ব্যবহারকারীরা অর্থপূর্ণ তুলনা করতে পারেন।'
অ্যানথ্রপিকের দুটি মডেলের স্কোর হেলথবেঞ্চ প্রফেশনাল ইভালে কিছুটা উন্নত হয়েছে — ক্লদ ফেবল ৫.১-এর ৫৬.৬% থেকে ৫৮.১% এবং ওপাস ৫-এর ৫৪.৫% থেকে ৫৬.৪% হয়েছে। অন্যান্য প্রতিষ্ঠানের মডেলের স্কোর সাধারণত প্রকাশিত লিডারবোর্ড থেকে নেওয়া হয়, নিজেরা প্রতিযোগীদের উপর পরীক্ষা চালায় না।
২০২৫ সালে মেটা তাদের Llama 4 মডেলের স্কোর কৃত্রিমভাবে বাড়ানোর অভিযোগ অস্বীকার করেছিল, কিন্তু পরে ইয়ান লেকুন স্বীকার করেন তারা ফলাফল 'ফাজ' করেছে। স্নোরকেল এআই-এর প্রকৌশলী ভিনসেন্ট সান চেন বলেছেন, লঞ্চের আগে বেঞ্চমার্ক স্কোর পরিবর্তন হওয়া অস্বাভাবিক নয়, কারণ মডেল চেকপয়েন্ট, কনফিগারেশন, হারনেস ইত্যাদি এখনও চূড়ান্ত পর্যায়ে থাকে। তিনি আশা প্রকাশ করেন যে সংস্থাগুলো পরিবর্তনের সময় কী কী বিষয় পরিবর্তিত হয়েছে তা রিপোর্ট করার শিল্পমান তৈরি হবে।
বেঞ্চমার্ক ফলাফল এআই কোম্পানিগুলোর অগ্রগতি পরিমাপের পাশাপাশি প্রতিযোগিতায় এগিয়ে থাকার একটি মাধ্যম। শীর্ষ লিডারবোর্ড ক্লায়েন্ট আকৃষ্ট করতে এবং ইঞ্জিনিয়ার নিয়োগে সহায়তা করে। তবে এই উদাহরণ দেখায় যে স্কোর ব্যাখ্যা করা প্রযুক্তিগতভাবে জটিল, এবং ভুল বোঝাবুঝি বিনিয়োগকারী ও গ্রাহকদের জন্য সমস্যা তৈরি করতে পারে। ২০২৭ সালে সম্ভাব্য আইপিওর আগে ওপেনএআই বাজারে সেরা মডেলের বার্তা দিতে চায়, কিন্তু এই পরিবর্তনগুলো সেই বর্ণনাকে ঝাপসা করতে পারে।




