ശക്തിയേറിയ എഐ മോഡലുകൾക്ക് ആവശ്യമേറുന്നുണ്ടെങ്കിലും അവയെ പരിശീലിപ്പിക്കാനും പ്രവർത്തിപ്പിക്കാനും ആവശ്യമായ കംപ്യൂട്ടിങ് ശേഷി കണ്ടെത്തുക വലിയൊരു പ്രശ്നമാണ്. ഇതിനായി ശക്തിയേറിയ ആയിരക്കണക്കിന് ഗ്രാഫിക് പ്രൊസസിങ് യൂണിറ്റുകൾ (ജിപിയു) ഉപയോഗിച്ചുള്ള ഡാറ്റാ സെന്ററുകൾ വേണം. നിലവിൽ മിക്ക കമ്പനികളും എൻവിഡിയ പോലുള്ള കമ്പനികളിൽ നിന്നുള്ള അതിശക്തമായ ജിപിയുകളെയാണ് ഇതിനായി ആശ്രയിക്കുന്നത്. എന്നാൽ യുഎസിൽ നിന്നുള്ള വ്യാപാര നിരോധനങ്ങളെ തുടർന്ന് ഇത്തരം ചിപ്പുകൾ വാങ്ങി ഉപയോഗിക്കാൻ ചൈനീസ് കമ്പനികൾക്ക് സാധിക്കില്ല. ഈ പരിമിതികൾക്കിടയിലും അമേരിക്കൻ എഐ മോഡലുകളെ വെല്ലുവിളിക്കുന്ന എഐ മോഡലുകൾ ചൈനീസ് കമ്പനികൾ പുറത്തിറക്കിയിട്ടുണ്ട്.

To advertise here,

എന്നാൽ ഇപ്പോഴിതാ, കൂടിയ വേഗത്തിലുള്ള എഐ മോഡലുകൾ നിർമിക്കാനുള്ള മാർഗം കണ്ടെത്തിയെന്നും അതിന് അതിനൂതനമായ ചിപ്പുകളുടെ ആവശ്യമില്ലെന്നും അവകാശപ്പെട്ട് രംഗത്തുവന്നിരിക്കുകയാണ് ചൈനീസ് എഐ സ്റ്റാർട്ടപ്പായ ഡീപ്പ് സീക്ക്. തങ്ങളുടെ ഫ്ലാഗ്ഷിപ്പ് വി4 മോഡൽ ഫാമിലിക്കായി അവതരിപ്പിച്ച ഡിസ്പാർക്ക് (DSpark) എന്ന സ്പെകുലേറ്റീവ് ഡീകോഡിങ് ഫ്രെയിംവർക്ക് എഐ മറുപടികളുടെ വേഗത 85 ശതമാനം വരെ വർധിപ്പിക്കുമെന്ന് ഡീപ്പ്സീക്ക് പറയുന്നു. ഉദാഹരണത്തിന്, മുൻപ് ഉപഭോക്താക്കളുടെ 100 ചോദ്യങ്ങൾ കൈകാര്യം ചെയ്തിരുന്ന ഒരു സിംഗിൾ ജിപിയുവിന് ഇനി ഏകദേശം 185 ചോദ്യങ്ങൾ വരെ പ്രോസസ്സ് ചെയ്യാൻ സാധിക്കും.

ഡിസ്പാർക്ക് എഐ മറുപടികളുടെ വേഗം വർധിപ്പിക്കുന്നത് എങ്ങനെ?

ഒരു ചോദ്യത്തിന് എഐ മോഡൽ മറുപടി നൽകാൻ എടുക്കുന്ന സമയം അഥവാ എഐ ഇൻഫറൻസ് കുറയ്ക്കാൻ ഡിസ്പാർക്ക് ഫ്രെയിംവർക്കിന് സാധിക്കുമെന്നാണ് ഡീപ്പ് സീക്ക് അവകാശപ്പെടുന്നത്.

സാധാരണയായി AI മോഡലുകൾ ഓരോ ടോക്കണുകളായാണ് (tokens) വിവരങ്ങൾ നൽകുന്നത്, ഇത് വലിയ ഉത്തരങ്ങൾ നൽകുമ്പോൾ കാലതാമസത്തിന് കാരണമാകുന്നു. എന്നാൽ ഡിസ്പാർക്കിൽ ഒരു ചെറിയ ഡ്രാഫ്റ്റ് മോഡൽ (lightweight draft model) ഉത്തരങ്ങൾ വേഗത്തിൽ നിർദ്ദേശിക്കുകയും, പിന്നീട് വലിയ പ്രധാന മോഡൽ അത് ബാച്ചുകളായി പരിശോധിച്ച് ഉറപ്പുവരുത്തുകയും ചെയ്യുന്നു. ചെറിയ മോഡൽ തയ്യാറാക്കിയ ഉത്തരങ്ങൾ ശരിയാണെങ്കിൽ സിസ്റ്റം വേഗത്തിൽ മുന്നോട്ട് പോവുകയും, തെറ്റാണെങ്കിൽ മാത്രം പിന്നോട്ട് പോയി തിരുത്തുകയും ചെയ്യുന്നു. ഭൂരിഭാഗം ടോക്കണുകളും എളുപ്പത്തിൽ പ്രവചിക്കാൻ കഴിയുന്നവയായതിനാൽ സിസ്റ്റത്തിന് വളരെ വേഗത്തിൽ പ്രവർത്തിക്കാൻ സാധിക്കുന്നു. ഓരോ ടോക്കണുകളായി ഉത്തരങ്ങൾ നൽകുന്നതിന് പകരം, ചെറിയ കൂട്ടങ്ങളായി ടോക്കണുകൾ ഉത്പാദിപ്പിക്കാൻ ഈ രീതി സഹായിക്കുന്നു, ഇത് പ്രക്രിയ കൂടുതൽ വേഗത്തിലാക്കുന്നു.

പെക്കിങ് സർവകലാശാലയുമായി ചേർന്ന് നടത്തിയ ഡിസ്പാർക്ക് ഗവേഷണം കമ്പനി ഗിറ്റ്ഹബ്ബിലും (GitHub) ഹഗ്ഗിങ്ഫേസിലും (HuggingFace) ഓപ്പൺ സോഴ്സ് ആയി ലഭ്യമാക്കിയിട്ടുണ്ട്. ഡിസ്പാർക്ക് ഒരു മോഡലിന്റെ പൊതുവായ കഴിവുകൾ വർധിപ്പിക്കുന്നില്ലെന്നും, എന്നാൽ കംപ്യൂട്ടിങ് റിസോഴ്സുകളിൽ വലിയ തോതിൽ അധിക നിക്ഷേപം നടത്താതെ തന്നെ കൂടുതൽ മികച്ച പ്രകടനം കൈവരിക്കാൻ കമ്പനികളെ സഹായിക്കുമെന്നും ഡീപ്പ്സീക്ക് പറയുന്നു.

വിപണിയിലുള്ള മറ്റ് ഓപ്പൺ-സോഴ്‌സ് മോഡലുകളായ ഗൂഗിളിന്റെ ജെമ്മ (Gemma), ആലിബാബയുടെ ക്വെൻ (Qwen) ഉൾപ്പെടെയുള്ള നിരവധി ഓപ്പൺ സോഴ്സ് മോഡലുകളിൽ കമ്പനി ഈ ഫ്രെയിംവർക്ക് പരീക്ഷിച്ചു വിജയിച്ചിട്ടുണ്ട്.