هوش مصنوعی » اخبار و روندهای هوش مصنوعی » ابزارهای جدید » ۵ خبر مهم هوش مصنوعی این هفته؛ از حافظه Claude تا مدل مرموز چینی

۵ خبر مهم هوش مصنوعی این هفته؛ از حافظه Claude تا مدل مرموز چینی

این هفته فره زان از اخبار هوش مصنوعی نفس نکشید؛ ۵ خبری که باید بدانید

این هفته در دنیای هوش مصنوعی پنج اتفاق مهم افتاد: Claude حافظه‌اش را بین Chat و Cowork یکپارچه کرد، گوگل قابلیت‌های تازه‌ای برای Gemini معرفی کرد و مدل چینی GLM-5.3-Flash پیش از معرفی رسمی توجه زیادی به خود جلب کرد.

در این مطلب همین پنج خبر را مرور می‌کنیم؛ چه اتفاقی افتاد و چرا هرکدام برایتان اهمیت دارد.

هوش مصنوعی، اخبار هوش مصنوعی، Claude، Gemini، اخبار AI، بهترین مدل هوش مصنوعی

Claude حالا حافظه مشترکی بین Chat و Cowork دارد

فرض کنید صبح با Claude در چت حرف می‌زنید و کامل توضیح می‌دهید دنبال چه چیزی هستید. عصر همان روز می‌روید سراغ Cowork، همان نسخه‌ای که کارها را خودش پیش می‌برد، و باز باید از اول شروع کنید. تا همین چند روز پیش دقیق همین بود. آنتروپیک این مشکل را حل کرد.

از ۲۵ اوت، هرچه در چت به Claude بگویید همان لحظه در Cowork هم هست، و برعکس. Claude دیگر منتظر پایان مکالمه نمی‌ماند تا حافظه بسازد؛ حین حرف زدن یادداشت برمی‌دارد. می‌توانید هرچه به خاطر سپرده را ببینید، موضوع به موضوع، و هرکدام را پاک یا تغییر دهید. موضوعاتی مثل سلامت یا هویت جنسیتی هم به‌صورت پیش‌فرض ذخیره نمی‌شوند، مگر خودتان بخواهید.


چرا این خبر اهمیت دارد؟
تا به امروز، گفت‌وگو با Claude و سپردن کار به Cowork به طور کلی دو تجربه جدا بودند و کاربر مجبور بود زمینه کارش را دوباره منتقل کند. حافظه مشترک این اصطکاک را کم می‌کند و یک قدم مهم به سمت دستیارهایی است که نه‌فقط به سؤال شما جواب می‌دهند، بلکه زمینه کارتان را به خاطر می‌سپارند و ادامه می‌دهند.

 

Gemini Live حالا به Spark برای انجام کارهای چندمرحله‌ای متصل می‌شود

سه روز بعد نوبت گوگل رسید. Gemini Live، همان قابلیت مکالمه‌ی صوتی گوگل، حالا به Spark وصل شده، سیستمی که کارهای چندمرحله‌ای را در پس‌زمینه پیش می‌برد. فرض کنید پشت رل نشسته‌اید و فکرهایتان را بی‌نظم برای گوگل تعریف می‌کنید. تا دفتر می‌رسید، یک سند مرتب در Google Docs منتظرتان است. حتی اگر کار چند روز طول بکشد، Spark هدف را گم نمی‌کند.

دستیارهای صوتی تا امروز بیشتر شبیه منشی بودند که فقط یادداشت می‌گرفتند. حالا صدا به‌جای این‌که فقط ورودی متن باشد، می‌تواند آغازگر یک کار چندمرحله‌ای در چند برنامه‌ی مختلف باشد.

 

Gemini 3.5 Transcribe به نرخ خطای ۲٫۶ درصد رسیده است

همان روزی که خبر Spark بیرون آمد، گوگل یک مدل دیگر هم معرفی کرد: Gemini 3.5 Transcribe، برای تبدیل گفتار به متن. طبق داده‌های Artificial Analysis، نرخ خطای کلمه (WER) این مدل در حالت غیر استریم به ۲٫۶ درصد رسیده؛ یعنی از هر صد کلمه، کمتر از سه‌تا اشتباه ثبت می‌شود.

چیزی که این مدل را متمایز می‌کند فقط دقت آن نیست؛ خودتصحیحی‌هایتان را هم می‌فهمد، برای نمونه وقتی می‌گویید «سه‌شنبه، نه بگذار چهارشنبه بگویم». کلمات پرکننده را حذف می‌کند و متن را تمیز تحویل می‌دهد. الان روی اندروید در قابلیت Rambler فعال است و به زودی سراغ Chrome هم می‌رود.

برای هرکسی که کارش پادکست، جلسه یا زیرنویس است، فاصله‌ی بین گفتار خام و متن آماده همیشه یک مرحله‌ی ویرایش دستی داشته. این مدل قول می‌دهد آن مرحله را حذف کند؛ باید دید در کار روزمره هم همین اندازه خوب عمل می‌کند یا نه.

 

GLM-5.3-Flash؛ مدلی که اول ناشناس بود و بعد معرفی شد

این یکی داستان جالبی دارد. چند روز قبل از معرفی رسمی، یک مدل ناشناس با نام مستعار «Ox Alpha» روی پلتفرم‌هایی مثل OpenRouter ظاهر شد. کاربران بدون این‌که بدانند پشتش کیست، شروع کردند به امتحان کردنش و خیلی زود پرترافیک‌ترین مدل آن هفته شد. بعد معلوم شد Z.ai، شرکت چینی، این مدل را از پیش رها کرده بود تا خودش امتحانش را پس بدهد. اسمش را گذاشتند GLM-5.3-Flash.

ویژگی‌ها و اعداد:

• معماری: Mixture-of-Experts، ۳۲۰ میلیارد پارامتر کل، ۱۸ میلیارد پارامتر فعال در هر توکن

• کانتکست: یک میلیون توکن

• عملکرد: در آزمون Terminal-Bench 2.1 نمره‌ی ۸۴٫۳ گرفته، در برابر ۸۵٫۰ برای Claude Opus 4.8

• قیمت: نزدیک به یک‌دهم مدل‌های بزرگ‌تر

• دسترسی: وزن‌ها زیر مجوز MIT روی Hugging Face، رایگان و قابل اجرا روی سرور خودتان

برای برنامه‌نویس یا تیمی که حجم بالای درخواست به مدل دارد، این فاصله‌ی کوچک با Opus کنار قیمت یک‌دهمی، معادله را عوض می‌کند. این عدد از بنچمارک داخلی خود Z.ai آمده؛ باید دید در پروژه‌های روزمره هم همین فاصله می‌ماند یا نه.

 

ویدیوی هوش مصنوعی این بار فراموش نمی‌کند

آخرین خبر باز از گوگل است: نسخه‌ی ۱.۱ مدل ویدیویی Gemini Omni. پیش از این، اگر می‌خواستید یک صحنه را ادامه بدهید، مدل فقط یک ثانیه‌ی آخر فوتیج را می‌دید و از آنجا حدس می‌زد. حالا ده ثانیه می‌بیند و صحنه را تا چهل ثانیه، بدون این‌که چهره‌ی شخصیت یا نورپردازی عوض شود، ادامه می‌دهد. می‌شود فریم اول و آخر یک شات را تعیین کرد، رفرنس ویدیویی داد تا حرکت دوربین حفظ شود، و خروجی را تا ۴K آپ‌اسکیل کرد. یک حالت ۳۶۰p هم هست، سریع‌تر و ارزان‌تر، برای وقتی فقط می‌خواهید یک ایده را زود امتحان کنید.

بزرگ‌ترین مشکل ویدیوی تولیدشده با هوش مصنوعی همیشه فراموشی بوده: شخصیت بین صحنه‌ها عوض می‌شود، نور می‌پرد. حافظه‌ی ده‌ثانیه‌ای به‌جای یک‌ثانیه‌ای، همان چیزی است که این مشکل را کوچک می‌کند.

 

در یک نگاه

خبر شرکت چه چیزی تغییر کرد؟ چرا اهمیت دارد؟
ادغام حافظه Claude آنتروپیک حافظه Chat و Cowork یکپارچه شد مرز چت و ایجنت کم‌رنگ‌تر می‌شود
Gemini Live + Spark گوگل دستور صوتی می‌تواند کار چندمرحله‌ای بسازد صدا از ورودی متن به آغازگر کار تبدیل می‌شود
Gemini 3.5 Transcribe گوگل نرخ خطا به ۲٫۶٪ رسیده است مرحله ویرایش دستی متن کوچک‌تر می‌شود
GLM-5.3-Flash Z.ai مدلی ارزان با عملکرد نزدیک به مدل‌های رده‌بالا معادله قیمت و کیفیت برای کاربران حجم‌بالا تغییر می‌کند
Gemini Omni 1.1 گوگل بسط صحنه از ۱ به ۱۰ ثانیه حافظه رسید پیوستگی ویدیوهای تولیدشده بهتر می‌شود

 

جمع‌بندی

اگر بخواهم از میان این پنج خبر از اخبار هوش مصنوعی یک روند را انتخاب کنم، آن روند عبور هوش مصنوعی از چت‌بات به عامل است. حافظه‌ی یکپارچه‌ی Claude، اتصال Gemini Live به Spark، حتی مدل ویدیویی که صحنه را ده برابر بهتر به خاطر می‌سپارد، همه یک نکته‌ی مشترک دارند: کمتر منتظر دستور شما می‌مانند و بیشتر خودشان ادامه می‌دهند. سؤالی که باقی می‌ماند این است که این ادامه‌ی خودکار تا کجا باید بدون نظارت پیش برود؛ همین سؤال را باید در خبرهای هفته‌های بعد دنبال کرد.

درباره نویسنــده

دیدگاهتان را بنویسید

فهرست مطالب

دسته بندی مطالب

عضـــــــویت در خـــــبرنامــه

برای دریافت آخرین خبرها ایمیل خود را ارسال کنید

آخرین مطالب فره زان