جوجل تطلق Gemini 3.5 Transcribe: طفرة جديدة في تحويل الصوت إلى نص
أعلنت جوجل عن إطلاق نموذجها الجديد Gemini 3.5 Transcribe، والذي يمثل قفزة نوعية في مجال تحويل الصوت إلى نص. يهدف هذا النموذج إلى تجاوز مجرد تسجيل الكلمات المنطوقة، حيث يتمتع بقدرة على فهم سياق الحديث والتعامل مع التصحيحات أثناء الكلام، مما يجعله أداة
أعلنت جوجل عن إطلاق نموذجها الجديد Gemini 3.5 Transcribe، والذي يمثل قفزة نوعية في مجال تحويل الصوت إلى نص. يهدف هذا النموذج إلى تجاوز مجرد تسجيل الكلمات المنطوقة، حيث يتمتع بقدرة على فهم سياق الحديث والتعامل مع التصحيحات أثناء الكلام، مما يجعله أداة مثالية لتقديم نصوص منظمة ودقيقة.
يعمل Gemini 3.5 Transcribe ضمن مجموعة من خدمات جوجل، حيث يتم استخدامه في ميزة Rambler على لوحة مفاتيح Gboard لأجهزة أندرويد، مع خطط لإطلاقه قريبًا داخل متصفح كروم. وقد صُمم هذا النموذج لفهم الطريقة الطبيعية التي يتحدث بها المستخدم، مما يساعده على استنتاج المعنى المقصود بدلاً من الاكتفاء بنقل الكلمات بشكل حرفي.
يمتاز النموذج بقدرته على التعامل مع المواقف التي يغير فيها المستخدم رأيه أثناء الحديث، فعلى سبيل المثال، إذا قال المستخدم: "سنلتقي الثلاثاء، لا الأربعاء"، يمكن للنموذج تصحيح المعلومة تلقائيًا. كما يقوم بإزالة كلمات الحشو والتردد مثل "آه" و"أمم"، مما يجعل النص الناتج أكثر سهولة في القراءة.
تستند جوجل في تقييم أداء النموذج إلى اختبارات أجرتها التحليل الاصطناعي، حيث أظهرت النتائج معدل خطأ في الكلمات (WER) بنسبة 4% في النسخ المباشر و2.6% في معالجة التسجيلات غير المباشرة. هذه النتائج تعكس قدرة النموذج على التعامل مع التسجيلات التي تحتوي على ضوضاء أو ظروف صوتية غير مثالية.
Gemini 3.5 Transcribe يدعم أكثر من 85 لغة، مع إمكانية اكتشاف اللغة تلقائيًا، مما يعزز فرص استخدامه في تطبيقات الصوت العالمية. كما يتضمن النظام تقنية للتعرف على المتحدثين داخل الملفات الصوتية المسجلة مسبقًا، مما يسمح بتحديد متحدثين وإضافة توقيتات إلى الكلام.
تخطط جوجل لتوسيع نطاق استخدام Gemini 3.5 Transcribe، حيث يمكن للمستخدمين استخدام صوته للكتابة مباشرة في حقول النص على مواقع الإنترنت، في خطوة تعكس توجه الشركة نحو تعزيز التفاعل الصوتي في تجربة استخدام الإنترنت.
بالإضافة إلى ذلك، يتيح النموذج ربطه بأدوات ونماذج ذكاء اصطناعي أخرى، مما يعزز من قدراته في تنفيذ مهام متعددة. وتظهر هذه الإمكانيات في تطبيق Gemini على أجهزة macOS، حيث يمكن للمستخدم إعطاء تعليمات صوتية، بينما يستفيد النظام من سياق الشاشة والملفات المفتوحة لتنفيذ الطلبات بدقة وسرعة.
💬 التعليقات 0