آیا جمینی گوگل واقعا بهتر از چت جی پی تی است؟

بعد- Google DeepMind اخیرا Gemini را معرفی کرده است که یک مدل هوش مصنوعی جدید برای رقابت با Chat GPT است. هر دو مدل نمونه‌هایی از “هوش مصنوعی مولد” هستند که یاد می‌گیرد الگوهایی را در اطلاعات ورودی برای تولید داده‌های جدید (تصاویر، کلمات یا رسانه‌های دیگر) بیابد، با این حال GPT Chat بر روی یک مدل زبان بزرگ (LLM) تمرکز می‌کند. .

به گزارش خبرگرافی به نقل از گفتگو، Chat GPT یک برنامه وب برای مکالمات است که مبتنی بر یک شبکه عصبی معروف به GPT (آموزش داده شده بر روی مقادیر بسیار زیاد متن) است. گوگل همچنین یک برنامه وب مکالمه به نام “Bard” را بر اساس مدلی به نام (LaMDA) (یادگیری شده در گفتگو) توسعه داد. گوگل اکنون این برنامه را بر اساس Gemini تبلیغ می کند.

چیزی که Gemini را از مدل های قبلی هوش مصنوعی متمایز می کند این است که یک مدل چند وجهی است. این بدان معناست که Gemini به طور مستقیم با حالت های ورودی و خروجی متعدد کار می کند: علاوه بر پشتیبانی از ورودی و خروجی متن، از تصاویر، صدا و ویدئو نیز پشتیبانی می کند.. بر این اساس، نام اختصاری جدیدی در حال ظهور است: LMM (مدل چند متغیره بزرگ)، که نباید با LLM اشتباه گرفته شود.

شرکت Open AI مدلی به نام GPT-4Vision معرفی کرده است که می تواند با تصاویر، صدا و متن کار کند. با این حال، این یک مدل کاملاً چند وجهی به روشی نیست که جمینی وعده داده است.

به عنوان مثال، در حالی که Chat GPT-4 با GPT-4V می تواند با ورودی صدا کار کند و خروجی گفتار تولید کند، این کار را با تبدیل گفتار به متن در ورودی با استفاده از یک مدل انجام می دهد. یکی دیگر از یادگیری های عمیق Whisper نام دارد. Chat GPT-4 همچنین متن را با استفاده از یک مدل خروجی متفاوت به گفتار تبدیل می کند، به این معنی که خود GPT-4V فقط با متن کار می کند.

به طور مشابه، ChatGPT-4 می‌تواند تصاویر تولید کند، اما این کار را با تولید پیام‌های متنی انجام می‌دهد که به یک مدل یادگیری عمیق جداگانه به نام Dall-E 2 ارسال می‌شود، که متن را به تصاویر تبدیل می‌کند.

در عوض، گوگل Gemini را به‌گونه‌ای طراحی کرد که به‌صورت «بومی چند شکلی» باشد، به این معنی که مدل اصلی به‌طور مستقیم طیفی از انواع ورودی (صوت، تصاویر، ویدیو و متن) را کنترل می‌کند و می‌تواند مستقیماً از آنها نیز خروجی بگیرد..

تمایز بین این دو رویکرد ممکن است آکادمیک به نظر برسد، اما مهم است. نتیجه کلی از گزارش فنی گوگل و سایر تست های کیفی تا به امروز این است که نسخه عمومی فعلی Gemini، Gemini 1.0 Pro، عموما به خوبی GPT-4 نیست و از نظر ویژگی ها بیشتر شبیه GPT 3.5 است.

گوگل همچنین نسخه قدرتمندتر Gemini را به نام Gemini 1.0 Ultra معرفی کرد و نتایجی ارائه کرد که نشان می‌دهد قدرتمندتر از GPT-4 است.. با این حال، ارزیابی این امر به دو دلیل دشوار است. دلیل اول این است که گوگل هنوز Ultra را منتشر نکرده است، بنابراین در حال حاضر نمی توان نتایج را به طور مستقل تأیید کرد.

دلیل دومی که چرا ارزیابی ادعاهای گوگل دشوار است این است که این شرکت تصمیم به انتشار یک ویدیو تا حدی گمراه کننده گرفت. به عنوان مثال، جمینی قبلاً چند کار خاص را یاد گرفته بود، مانند ترفند سه فنجان و توپ، که در آن او پیگیری می کند که توپ زیر کدام جام است. برای این کار، دنباله ای از تصاویر ثابت ارائه شد که در آن دست های مجری بر روی فنجان های در حال تغییر بود.

آینده امیدوار کننده

با وجود همه اینها جمینی و مدل‌های چندوجهی بزرگ گامی رو به جلو برای هوش مصنوعی مولد هستندد این به دلیل قابلیت های آینده آنها و همچنین چشم انداز رقابتی ابزارهای هوش مصنوعی است. GPT-4 بر روی حدود 500 میلیارد کلمه تمام متن با کیفیت خوب در دسترس عموم آموزش داده شد.

عملکرد مدل‌های یادگیری عمیق عموماً با افزایش پیچیدگی مدل و مقدار داده‌های آموزشی هدایت می‌شود. این وضعیت منجر به این سوال شده است که چگونه می توان پیشرفت های بیشتری انجام داد، زیرا داده های آموزشی جدید برای مدل های زبان تقریباً تمام شده است. با این حال، مدل‌های چندوجهی، ذخیره‌های جدیدی از داده‌های آموزشی را در قالب تصاویر، صدا و ویدئو باز می‌کنند.

ابزارهای مبتنی بر هوش مصنوعی مانند Gemini که می توانند مستقیماً بر روی همه این داده ها آموزش داده شوند، احتمالاً در آینده قابلیت های بسیار بیشتری خواهند داشت.. همچنین ایجاد یک چشم انداز رقابتی از هوش مصنوعی انسان را به هیجان می آورد. علیرغم ظهور بسیاری از مدل‌های هوش مصنوعی مولد در سال گذشته، مدل‌های GPT ساخته شده توسط Open AI غالب بوده‌اند و سطحی از عملکرد را نشان می‌دهند که سایر مدل‌ها نتوانسته‌اند به آن نزدیک شوند.

جمینی گوگل نشان دهنده ظهور یک رقیب بزرگ است که به پیشبرد این چشم انداز کمک می کند. البته، Open AI تقریباً به طور قطع بر روی GPT-5 اجرا خواهد شد و می‌توان انتظار داشت که چندوجهی نیز باشد و قابلیت‌های جدید قابل توجهی داشته باشد. همچنین، برخی از ویژگی های پیاده سازی Gemini دوست داشتنی است. به عنوان مثال، گوگل نسخه ای به نام «جمینی نانو» را معرفی کرده است که بسیار سبک تر است و می تواند مستقیماً روی گوشی های هوشمند اجرا شود.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *