न्यूयॉर्क। OpenAI ने अपने API के जरिए तैयार किए जाने वाले टेक्स्ट के लिए वॉटरमार्किंग सिस्टम पेश किया है। कंपनी ने इसे textGrain नाम दिया है। इस तकनीक के जरिए AI मॉडल उपयुक्त शब्दों के बीच चयन करते समय कुछ शब्दों को सांख्यिकीय रूप से प्राथमिकता देकर ऐसा पैटर्न तैयार करता है, जिसे बाद में OpenAI का डिटेक्टर पहचान सकता है। हालांकि, API के लिए यह सुविधा डिफॉल्ट रूप से बंद रहेगी और डेवलपर्स अपनी जरूरत के अनुसार इसे सक्रिय कर सकेंगे।
OpenAI के मुताबिक, दुनिया भर के API ग्राहक समर्थित मॉडलों के लिए टेक्स्ट वॉटरमार्किंग को सक्रिय करने का विकल्प चुन सकते हैं। कंपनी आने वाले हफ्तों में यूरोपीय संघ में ChatGPT और Codex से तैयार होने वाले पात्र टेक्स्ट पर वॉटरमार्किंग अपने आप लागू करना शुरू करेगी। यह कदम यूरोपीय संघ के AI कानून के तहत लागू होने वाली नई पारदर्शिता आवश्यकताओं के अनुरूप उठाया जा रहा है।
OpenAI की व्यवस्था Anthropic के मॉडल से अलग है। Anthropic ने अगस्त में Claude के लिए टेक्स्ट वॉटरमार्किंग की घोषणा करते हुए कहा था कि समर्थित Claude मॉडलों पर इसे वैश्विक स्तर पर लागू किया जाएगा। वहां मॉडल स्तर पर वॉटरमार्क मौजूद रहेगा, यानी Claude के अलग-अलग उत्पादों या API के जरिए तैयार किए गए टेक्स्ट पर भी यह लागू होगा। इसके विपरीत OpenAI API ग्राहकों को यह तय करने का विकल्प दे रहा है कि वे वॉटरमार्किंग का इस्तेमाल करना चाहते हैं या नहीं।
OpenAI API में textGrain को प्रोजेक्ट या संगठन स्तर पर सक्रिय किया जा सकता है। ग्राहक यह भी चुन सकते हैं कि किन समर्थित मॉडलों पर वॉटरमार्किंग लागू हो। फीचर सक्रिय होने के बाद अलग-अलग API अनुरोधों में किसी अतिरिक्त बदलाव की जरूरत नहीं होगी।
OpenAI पहले से ही AI से तैयार सामग्री की उत्पत्ति और पहचान के लिए अलग-अलग तकनीकों का इस्तेमाल कर रहा है। कंपनी ने 2024 में AI से बनाई गई तस्वीरों में Content Credentials जोड़ना शुरू किया था। इसके बाद मई 2026 में कुछ समर्थित तस्वीरों और जुलाई में ऑडियो के लिए Google की SynthID तकनीक का इस्तेमाल शुरू किया गया। अब टेक्स्ट के लिए textGrain को शामिल किया गया है।
कंपनी के अनुसार, textGrain को इसलिए विकसित किया गया क्योंकि इससे वॉटरमार्क की पहचान क्षमता और एक ही सवाल के अलग-अलग जवाब तैयार करने की विविधता के बीच बेहतर संतुलन बनाए रखने में मदद मिलती है। OpenAI का कहना है कि उसके परीक्षणों में textGrain ने SynthID के बराबर या उससे बेहतर पहचान प्रदर्शन किया। कंपनी इस तकनीक को ओपन सोर्स करने की भी योजना बना रही है, ताकि दूसरे शोधकर्ता और डेवलपर्स इस पर आगे काम कर सकें।
हालांकि, टेक्स्ट वॉटरमार्किंग की कुछ सीमाएं भी हैं। OpenAI के परीक्षणों के अनुसार, मनोविज्ञान जैसे क्षेत्रों में 200 टोकन वाले वॉटरमार्क किए गए टेक्स्ट की पहचान करीब 80 प्रतिशत मामलों में हुई, जबकि 400 टोकन के टेक्स्ट में यह दर करीब 95 प्रतिशत रही। गणित जैसे अधिक सीमित विषयों में पहचान की क्षमता कम हो सकती है, क्योंकि ऐसे टेक्स्ट में उपयुक्त शब्दों के विकल्प कम होते हैं।
टेक्स्ट में बदलाव करने पर भी वॉटरमार्क कमजोर हो सकता है। OpenAI के परीक्षण में 400 टोकन वाले टेक्स्ट के 10 प्रतिशत शब्दों को समानार्थी शब्दों से बदलने पर पहचान दर करीब 92 प्रतिशत से घटकर 66 प्रतिशत रह गई। 25 प्रतिशत शब्द बदलने पर यह दर केवल 17 प्रतिशत रह गई। बहुत छोटे टेक्स्ट में भी वॉटरमार्क की विश्वसनीय पहचान मुश्किल हो सकती है।
कोड के मामले में चुनौती और बड़ी है। OpenAI के अनुसार, सामान्य भाषा की तुलना में कोड में अगले शब्द या संकेत के लिए संभावित विकल्प कम होते हैं, इसलिए उसमें वॉटरमार्क डालना कठिन है। कंपनी यूरोपीय संघ में Codex के पात्र टेक्स्ट आउटपुट पर भी वॉटरमार्किंग लागू करने की योजना बना रही है, लेकिन अभी यह स्पष्ट नहीं किया गया है कि पात्र आउटपुट में सीधे तैयार किया गया स्रोत कोड शामिल होगा या नहीं।
OpenAI ने कोडिंग प्रदर्शन पर भी परीक्षण किया है। कंपनी के अनुसार, Astra मॉडल को वॉटरमार्किंग के साथ और उसके बिना विभिन्न कोडिंग तथा एजेंट बेंचमार्क पर जांचने में प्रदर्शन में कोई महत्वपूर्ण अंतर नहीं मिला। हालांकि, इससे यह साबित नहीं होता कि बाद में ऐसे कोड की पहचान कितनी विश्वसनीयता से की जा सकेगी।
वॉटरमार्क पहचानने वाले डिटेक्टर की उपलब्धता भी सीमित रखी गई है। textGrain का इस्तेमाल करने वाले API ग्राहकों को स्वतः डिटेक्टर की सुविधा नहीं मिलेगी। फिलहाल OpenAI इसकी पहुंच ऐसे स्वीकृत शोध और अकादमिक संस्थानों तक सीमित कर रहा है, जो टेक्स्ट की उत्पत्ति, वॉटरमार्क पहचान और इसकी विश्वसनीयता का अध्ययन कर रहे हैं।
