loading...

gesmatdovom

بازدید : 155
پنجشنبه 22 خرداد 1399 زمان : 11:06

امتیازات اخیر Dota 2 در OpenAI ، جایی که افرادشان ماه ها برای آموزش سیستم هوش مصنوعی جدید به سر می بردند تا ربات ها بتوانند به عنوان یک تیم در کنار یکدیگر بازی کنند ، نوشتن روی دیوار را تحسین کرده بودند: بازی تیمی در بازی های ویدیویی چند نفره در حال حاضر یک کانون داغ در AI است. .


محققان این چالش را در مورد چگونگی تحقق این امر در سطوح پیشرفته نشان می دهند. (چرا همیشه کار گروهی هوش مصنوعی به عنوان یک چالش توصیف می شود؟ آیا نایت در بررسی فناوری MIT می گوید ، "کار تیمی برای توسعه موثر در برنامه های هوش مصنوعی بسیار دشوار است ، زیرا این امر مستلزم برخورد با یک وضعیت پیچیده و همیشه در حال تغییر است.")

این هفته شما اثبات حضور در تیم ستارگان دیگری را دارید ، این بار کار DeepMind. آنها به طور وفادار نشان دادند كه چگونه هوش مصنوعی می تواند حریفان انسانی را در یک بازی چند نفره از بین ببرد. دانشمندان و مهندسان DeepMind به ما یادآوری کردند که چگونه عوامل هوش مصنوعی می توانند با هم بازی کنند و در برخی موارد از انسانها در بازی تعاونی پیشی بگیرند.

شوالیه MIT Technology Review ، با ارسال مطلب در بارگیری ، گفت که عوامل هوش مصنوعی توسط DeepMind در نسخه اصلاح شده ای از Quake III Arena آموزش داده شده اند. مهارت های کار تیمی در رژه بودند - مأمورین بازی Capture The Flag (CTF) را در Quake III Arena بازی کردند.

برای کسانی که با CTF و Quake III Arena آشنا نیستند ، یک مرور کلی از Rob LeFebvre می تواند کمک کند. او با نوشتن در Engadget ، چالش آنها را توضیح داد.

وی گفت: "این تیم بر روی گرفتن حالت پرچم متمرکز شده است ، نقشه ای که در آن نقشه از حالت مختلف به یکدیگر تغییر می کند. عوامل سازمان هوش مصنوعی آن مجبور بودند استراتژی های کلی را یاد بگیرند تا بتوانند با هر نقشه جدید سازگار شوند ، کاری که انسان به راحتی انجام می دهد. هم با اعضای تیم همکاری می کنند و هم مقابل تیم مقابل رقابت می کنند و می توانند با سبک های مختلف بازی دشمن سازگار شوند . "

یک مسابقات آزمایشی شامل افرادی بود که CTF را با عوامل آموزش دیده و علیه آنها بازی می کردند.


عوامل "For the Win" (FTW) آموختند که از روشهای پایه قوی قوی تر شوند و از نرخ برنده بازیکنان انسانی فراتر رفت. در یک نظرسنجی در بین شرکت کنندگان ، آنها نسبت به شرکت کنندگان انسانی امتیاز بیشتری کسب کردند.

همانطور که MIT Technology Review اظهار داشت ، "مأموران هوش مصنوعی همچنین می توانند با بازیکنان انسانی همکاری کنند. و این بازیکنان می گویند که این برنامه ها از سایر افراد هم تیمی بهتری هستند ."



"دو تیم از بازیکنان انفرادی با هدف گرفتن پرچم تیم حریف ضمن محافظت از خود ، بر روی نقشه مشخصی رقابت می کنند. برای به دست آوردن مزیت تاکتیکی می توانند اعضای تیم حریف را برچسب بزنند تا آنها را به نقاط تخم ریزی خود برگردانند. این تیم با بیشترین امتیاز پرچم پس از پنج دقیقه برنده شد. "

تلگراف بازی را "ماز با هدف گرفتن پرچم تیم حریف در حین محافظت از خود" توصیف کرد.

برای مارگی مورفی در تلگراف ، آنچه که در مورد این شاهکار جالب توجه است این است که "به نظر می رسد هوش مصنوعی DeepMind برای به دست آوردن بازی ها ، تاکتیک های روانشناختی معمولی انسانی را انتخاب می کند - به جای به خاطر سپردن نقشه بازی و نتایج احتمالی از یک حرکت."

Khari Johnson در The Verge گفت: The For the Win (FTW) AI نزدیک به 450،000 بازی Quake III Arena را به دست آورد تا تسلط خود را بر بازیکنان انسانی کسب کند ، و درک خود را از نحوه کارآمد با دیگر ماشین ها و انسان ها برقرار کند.

جانسون نتایج بازی را دوباره بدست آورد.


پرچم های ضبط شده: "به طور متوسط ، تیم های ماشین سازی بشر 16 پرچم در هر بازی را کمتر از تیم دو نماینده FTW ضبط کردند ."

عملکرد برچسب زدن: "مشخص شد که عوامل در برچسب زدن کارآمدتر از انسانها هستند ، و رسیدن به تاکتیک 80 درصد از زمان در مقایسه با انسانها 48 درصد است." (برچسب زدن شامل تماس با حریف برای ارسال آنها به نقطه تخم ریزی آنها است.)

رفتار: یک نظرسنجی از شرکت کنندگان انسانی "FTW را بیشتر از هم تیمی های انسانی همکاری می کند."

وبلاگ DeepMind برای هر کسی که علاقه مند به روند آموزش هوش مصنوعی برای چنین سناریویی در بازی های ویدیویی چند نفره است ، جالب است.

وی گفت: "ما به جای آموزش یک عامل واحد ، ما جمعیتی از مأمورین را آموزش می دهیم که با بازی با یکدیگر یاد می گیرند و تنوع هم تیمی و حریف خود را فراهم می کنند.

"هر عامل در جمعیت ، سیگنال پاداش داخلی خود را می آموزد ، که به مأموران امکان می دهد اهداف داخلی خود را مانند گرفتن یک پرچم تولید کنند. یک فرآیند بهینه سازی دو لایه ، پاداشهای داخلی مأمورین را به طور مستقیم برای برنده شدن بهینه می کند ، و از یادگیری تقویت کننده در پاداش های داخلی برای یادگیری سیاست های نمایندگان.

"عوامل در دو بازه زمانی سریع ، کند و کند عمل می کنند ، که توانایی آنها در استفاده از حافظه و تولید توالی عملکرد مداوم را بهبود می بخشد."

امتیازات اخیر Dota 2 در OpenAI ، جایی که افرادشان ماه ها برای آموزش سیستم هوش مصنوعی جدید به سر می بردند تا ربات ها بتوانند به عنوان یک تیم در کنار یکدیگر بازی کنند ، نوشتن روی دیوار را تحسین کرده بودند: بازی تیمی در بازی های ویدیویی چند نفره در حال حاضر یک کانون داغ در AI است. .


محققان این چالش را در مورد چگونگی تحقق این امر در سطوح پیشرفته نشان می دهند. (چرا همیشه کار گروهی هوش مصنوعی به عنوان یک چالش توصیف می شود؟ آیا نایت در بررسی فناوری MIT می گوید ، "کار تیمی برای توسعه موثر در برنامه های هوش مصنوعی بسیار دشوار است ، زیرا این امر مستلزم برخورد با یک وضعیت پیچیده و همیشه در حال تغییر است.")

این هفته شما اثبات حضور در تیم ستارگان دیگری را دارید ، این بار کار DeepMind. آنها به طور وفادار نشان دادند كه چگونه هوش مصنوعی می تواند حریفان انسانی را در یک بازی چند نفره از بین ببرد. دانشمندان و مهندسان DeepMind به ما یادآوری کردند که چگونه عوامل هوش مصنوعی می توانند با هم بازی کنند و در برخی موارد از انسانها در بازی تعاونی پیشی بگیرند.

شوالیه MIT Technology Review ، با ارسال مطلب در بارگیری ، گفت که عوامل هوش مصنوعی توسط DeepMind در نسخه اصلاح شده ای از Quake III Arena آموزش داده شده اند. مهارت های کار تیمی در رژه بودند - مأمورین بازی Capture The Flag (CTF) را در Quake III Arena بازی کردند.

برای کسانی که با CTF و Quake III Arena آشنا نیستند ، یک مرور کلی از Rob LeFebvre می تواند کمک کند. او با نوشتن در Engadget ، چالش آنها را توضیح داد.

وی گفت: "این تیم بر روی گرفتن حالت پرچم متمرکز شده است ، نقشه ای که در آن نقشه از حالت مختلف به یکدیگر تغییر می کند. عوامل سازمان هوش مصنوعی آن مجبور بودند استراتژی های کلی را یاد بگیرند تا بتوانند با هر نقشه جدید سازگار شوند ، کاری که انسان به راحتی انجام می دهد. هم با اعضای تیم همکاری می کنند و هم مقابل تیم مقابل رقابت می کنند و می توانند با سبک های مختلف بازی دشمن سازگار شوند . "

یک مسابقات آزمایشی شامل افرادی بود که CTF را با عوامل آموزش دیده و علیه آنها بازی می کردند.


عوامل "For the Win" (FTW) آموختند که از روشهای پایه قوی قوی تر شوند و از نرخ برنده بازیکنان انسانی فراتر رفت. در یک نظرسنجی در بین شرکت کنندگان ، آنها نسبت به شرکت کنندگان انسانی امتیاز بیشتری کسب کردند.

همانطور که MIT Technology Review اظهار داشت ، "مأموران هوش مصنوعی همچنین می توانند با بازیکنان انسانی همکاری کنند. و این بازیکنان می گویند که این برنامه ها از سایر افراد هم تیمی بهتری هستند ."



"دو تیم از بازیکنان انفرادی با هدف گرفتن پرچم تیم حریف ضمن محافظت از خود ، بر روی نقشه مشخصی رقابت می کنند. برای به دست آوردن مزیت تاکتیکی می توانند اعضای تیم حریف را برچسب بزنند تا آنها را به نقاط تخم ریزی خود برگردانند. این تیم با بیشترین امتیاز پرچم پس از پنج دقیقه برنده شد. "

تلگراف بازی را "ماز با هدف گرفتن پرچم تیم حریف در حین محافظت از خود" توصیف کرد.

برای مارگی مورفی در تلگراف ، آنچه که در مورد این شاهکار جالب توجه است این است که "به نظر می رسد هوش مصنوعی DeepMind برای به دست آوردن بازی ها ، تاکتیک های روانشناختی معمولی انسانی را انتخاب می کند - به جای به خاطر سپردن نقشه بازی و نتایج احتمالی از یک حرکت."

Khari Johnson در The Verge گفت: The For the Win (FTW) AI نزدیک به 450،000 بازی Quake III Arena را به دست آورد تا تسلط خود را بر بازیکنان انسانی کسب کند ، و درک خود را از نحوه کارآمد با دیگر ماشین ها و انسان ها برقرار کند.

جانسون نتایج بازی را دوباره بدست آورد.


پرچم های ضبط شده: "به طور متوسط ، تیم های ماشین سازی بشر 16 پرچم در هر بازی را کمتر از تیم دو نماینده FTW ضبط کردند ."

عملکرد برچسب زدن: "مشخص شد که عوامل در برچسب زدن کارآمدتر از انسانها هستند ، و رسیدن به تاکتیک 80 درصد از زمان در مقایسه با انسانها 48 درصد است." (برچسب زدن شامل تماس با حریف برای ارسال آنها به نقطه تخم ریزی آنها است.)

رفتار: یک نظرسنجی از شرکت کنندگان انسانی "FTW را بیشتر از هم تیمی های انسانی همکاری می کند."

وبلاگ DeepMind برای هر کسی که علاقه مند به روند آموزش هوش مصنوعی برای چنین سناریویی در بازی های ویدیویی چند نفره است ، جالب است.

وی گفت: "ما به جای آموزش یک عامل واحد ، ما جمعیتی از مأمورین را آموزش می دهیم که با بازی با یکدیگر یاد می گیرند و تنوع هم تیمی و حریف خود را فراهم می کنند.

"هر عامل در جمعیت ، سیگنال پاداش داخلی خود را می آموزد ، که به مأموران امکان می دهد اهداف داخلی خود را مانند گرفتن یک پرچم تولید کنند. یک فرآیند بهینه سازی دو لایه ، پاداشهای داخلی مأمورین را به طور مستقیم برای برنده شدن بهینه می کند ، و از یادگیری تقویت کننده در پاداش های داخلی برای یادگیری سیاست های نمایندگان.

"عوامل در دو بازه زمانی سریع ، کند و کند عمل می کنند ، که توانایی آنها در استفاده از حافظه و تولید توالی عملکرد مداوم را بهبود می بخشد."

نظرات این مطلب

تعداد صفحات : 0

درباره ما
موضوعات
آمار سایت
  • کل مطالب : 6
  • کل نظرات : 0
  • افراد آنلاین : 1
  • تعداد اعضا : 0
  • بازدید امروز : 6
  • بازدید کننده امروز : 1
  • باردید دیروز : 1
  • بازدید کننده دیروز : 0
  • گوگل امروز : 0
  • گوگل دیروز : 0
  • بازدید هفته : 9
  • بازدید ماه : 11
  • بازدید سال : 172
  • بازدید کلی : 2343
  • <
    پیوندهای روزانه
    آرشیو
    اطلاعات کاربری
    نام کاربری :
    رمز عبور :
  • فراموشی رمز عبور؟
  • خبر نامه


    معرفی وبلاگ به یک دوست


    ایمیل شما :

    ایمیل دوست شما :



    کدهای اختصاصی