بعد- Google DeepMind اخیرا Gemini را معرفی کرده است که یک مدل هوش مصنوعی جدید برای رقابت با Chat GPT است. هر دو مدل نمونههایی از “هوش مصنوعی مولد” هستند که یاد میگیرد الگوهایی را در اطلاعات ورودی برای تولید دادههای جدید (تصاویر، کلمات یا رسانههای دیگر) بیابد، با این حال GPT Chat بر روی یک مدل زبان بزرگ (LLM) تمرکز میکند. .
به گزارش خبرگرافی به نقل از گفتگو، Chat GPT یک برنامه وب برای مکالمات است که مبتنی بر یک شبکه عصبی معروف به GPT (آموزش داده شده بر روی مقادیر بسیار زیاد متن) است. گوگل همچنین یک برنامه وب مکالمه به نام “Bard” را بر اساس مدلی به نام (LaMDA) (یادگیری شده در گفتگو) توسعه داد. گوگل اکنون این برنامه را بر اساس Gemini تبلیغ می کند.
چیزی که Gemini را از مدل های قبلی هوش مصنوعی متمایز می کند این است که یک مدل چند وجهی است. این بدان معناست که Gemini به طور مستقیم با حالت های ورودی و خروجی متعدد کار می کند: علاوه بر پشتیبانی از ورودی و خروجی متن، از تصاویر، صدا و ویدئو نیز پشتیبانی می کند.. بر این اساس، نام اختصاری جدیدی در حال ظهور است: LMM (مدل چند متغیره بزرگ)، که نباید با LLM اشتباه گرفته شود.
شرکت Open AI مدلی به نام GPT-4Vision معرفی کرده است که می تواند با تصاویر، صدا و متن کار کند. با این حال، این یک مدل کاملاً چند وجهی به روشی نیست که جمینی وعده داده است.
به عنوان مثال، در حالی که Chat GPT-4 با GPT-4V می تواند با ورودی صدا کار کند و خروجی گفتار تولید کند، این کار را با تبدیل گفتار به متن در ورودی با استفاده از یک مدل انجام می دهد. یکی دیگر از یادگیری های عمیق Whisper نام دارد. Chat GPT-4 همچنین متن را با استفاده از یک مدل خروجی متفاوت به گفتار تبدیل می کند، به این معنی که خود GPT-4V فقط با متن کار می کند.
به طور مشابه، ChatGPT-4 میتواند تصاویر تولید کند، اما این کار را با تولید پیامهای متنی انجام میدهد که به یک مدل یادگیری عمیق جداگانه به نام Dall-E 2 ارسال میشود، که متن را به تصاویر تبدیل میکند.
در عوض، گوگل Gemini را بهگونهای طراحی کرد که بهصورت «بومی چند شکلی» باشد، به این معنی که مدل اصلی بهطور مستقیم طیفی از انواع ورودی (صوت، تصاویر، ویدیو و متن) را کنترل میکند و میتواند مستقیماً از آنها نیز خروجی بگیرد..
تمایز بین این دو رویکرد ممکن است آکادمیک به نظر برسد، اما مهم است. نتیجه کلی از گزارش فنی گوگل و سایر تست های کیفی تا به امروز این است که نسخه عمومی فعلی Gemini، Gemini 1.0 Pro، عموما به خوبی GPT-4 نیست و از نظر ویژگی ها بیشتر شبیه GPT 3.5 است.
گوگل همچنین نسخه قدرتمندتر Gemini را به نام Gemini 1.0 Ultra معرفی کرد و نتایجی ارائه کرد که نشان میدهد قدرتمندتر از GPT-4 است.. با این حال، ارزیابی این امر به دو دلیل دشوار است. دلیل اول این است که گوگل هنوز Ultra را منتشر نکرده است، بنابراین در حال حاضر نمی توان نتایج را به طور مستقل تأیید کرد.
دلیل دومی که چرا ارزیابی ادعاهای گوگل دشوار است این است که این شرکت تصمیم به انتشار یک ویدیو تا حدی گمراه کننده گرفت. به عنوان مثال، جمینی قبلاً چند کار خاص را یاد گرفته بود، مانند ترفند سه فنجان و توپ، که در آن او پیگیری می کند که توپ زیر کدام جام است. برای این کار، دنباله ای از تصاویر ثابت ارائه شد که در آن دست های مجری بر روی فنجان های در حال تغییر بود.
آینده امیدوار کننده
با وجود همه اینها جمینی و مدلهای چندوجهی بزرگ گامی رو به جلو برای هوش مصنوعی مولد هستندد این به دلیل قابلیت های آینده آنها و همچنین چشم انداز رقابتی ابزارهای هوش مصنوعی است. GPT-4 بر روی حدود 500 میلیارد کلمه تمام متن با کیفیت خوب در دسترس عموم آموزش داده شد.
عملکرد مدلهای یادگیری عمیق عموماً با افزایش پیچیدگی مدل و مقدار دادههای آموزشی هدایت میشود. این وضعیت منجر به این سوال شده است که چگونه می توان پیشرفت های بیشتری انجام داد، زیرا داده های آموزشی جدید برای مدل های زبان تقریباً تمام شده است. با این حال، مدلهای چندوجهی، ذخیرههای جدیدی از دادههای آموزشی را در قالب تصاویر، صدا و ویدئو باز میکنند.
ابزارهای مبتنی بر هوش مصنوعی مانند Gemini که می توانند مستقیماً بر روی همه این داده ها آموزش داده شوند، احتمالاً در آینده قابلیت های بسیار بیشتری خواهند داشت.. همچنین ایجاد یک چشم انداز رقابتی از هوش مصنوعی انسان را به هیجان می آورد. علیرغم ظهور بسیاری از مدلهای هوش مصنوعی مولد در سال گذشته، مدلهای GPT ساخته شده توسط Open AI غالب بودهاند و سطحی از عملکرد را نشان میدهند که سایر مدلها نتوانستهاند به آن نزدیک شوند.
جمینی گوگل نشان دهنده ظهور یک رقیب بزرگ است که به پیشبرد این چشم انداز کمک می کند. البته، Open AI تقریباً به طور قطع بر روی GPT-5 اجرا خواهد شد و میتوان انتظار داشت که چندوجهی نیز باشد و قابلیتهای جدید قابل توجهی داشته باشد. همچنین، برخی از ویژگی های پیاده سازی Gemini دوست داشتنی است. به عنوان مثال، گوگل نسخه ای به نام «جمینی نانو» را معرفی کرده است که بسیار سبک تر است و می تواند مستقیماً روی گوشی های هوشمند اجرا شود.