شماره مدرك
21261
شماره راهنما
18205
پديد آورنده
هشام صالح المنصور، سلوان
عنوان
يادگيري گشتاور متقارن كمكي براي اسكلتهاي بيروني پايينتنه با استفاده از يادگيري تقويتي عميق
مقطع تحصيلي
كارشناسي ارشد
گرايش تحصيلي
بيو الكترونيك
محل تحصيل
اصفهان : دانشگاه صنعتي اصفهان
سال دفاع
1405
صفحه شمار
55 ص.
توصيفگر ها
- اسكلت بيروني دوپا، - يادگيري تقويتي عميق، - بهينهسازي مصرف انرژي، - ديناميك صفر تركيبي، - كنترل متقارن
تاريخ ورود اطلاعات
1405/07/01
كتابنامه
كتابنامه
رشته تحصيلي
مهندسي پزشكي
دانشكده
مهندسي برق و كامپيوتر
تاريخ ويرايش اطلاعات
1405/07/01
كد ايرانداك
23253632
چكيده فارسي
اسكلتهاي بيروني پوشيدني اندام تحتاني بهطور سنتي با يك تعارض بنيادين ميان پايداري راهرفتن و بازدهي مصرف انرژي مواجهاند: كنترل رديابي با بهره بالا ايمني را تضمين ميكند اما هزينه مكانيكي بالايي دارد، در حالي كه كنترل تطبيقپذير انرژي را كاهش ميدهد اما مقاومبودن سامانه را به خطر مياندازد. در اين پاياننامه، يك كنترلكننده كمكي مبتني بر يادگيري تقويتي عميق براي يك اسكلت بيروني ششمفصلي اندام تحتاني توسعه داده شده است كه با الگوريتم بهينهسازي سياست پروگزيمال (PPO) در يك شبيهسازي جفتشده انسان-اسكلتبيروني آموزش ميبيند. كاربر انساني بهصورت يك كنترلكننده راهرفتن متناوب و خودهمگامشونده، مبتني بر چارچوب ديناميك صفر تركيبي و قيدهاي مجازي بيزيه با فاز وابسته به حالت سامانه، مدلسازي شده است؛ رويكردي كه سامانه جفتشده را در سراسر آموزش پايدار نگه ميدارد. سياست كمكي با يك تابع پاداش چندهدفه آموزش ميبيند كه ميان سرعت پيشروي اشباعشده، جريمه انرژي نرمالشده به تفكيك هر مفصل، قيد سخت پايداري وضعيتي، و جريمه تقارن هندسي توازن برقرار ميكند. براي بهبود كارايي نمونه و تقويت الگوي راهرفتن متقارن، از افزايش داده مبتني بر حالتهاي آينهشده استفاده شده و سازگاري با زمينهاي شيبدار از طريق يك معماري ديناميك پسماند سبكوزن، بدون بازآموزي سياست پايه، محقق شده است. نتايج نشان ميدهند كه در سرعتي نزديك به سرعت راهرفتن بدون كمك (حدود 1 متر بر ثانيه در برابر 1/13 متر بر ثانيه)، سياست آموختهشده هزينه حملونقل مكانيكي كاربر را حدود 14 درصد كاهش ميدهد (هزينه حملونقل كل نزديك به 7/82، كه سهم اسكلت بيروني از آن در سه اجراي مستقل آموزش بين 9/5 تا 14/6 درصد متغير است)، در حالي كه تقابل گشتاور ميان كاربر و دستگاه پايين، و ارتفاع طبيعي لگن و تقارن دوطرفه گامبرداري حفظ ميشوند. الگوي حاصل در برابر اغتشاشهاي بيروني تا 150 نيوتن مقاوم است و در سه از پنج اجراي مستقل آموزش به سياستي يكسان و كارآمد همگرا ميشود. اين پژوهش نشان ميدهد كه تركيب يك مدل كاربر مبتني بر قيد مجازي با يك پاداش چندهدفه بهدقت طراحيشده، ميتواند بدون نياز به سختافزار انطباقپذير جديد، بازدهي انرژي قابلتوجهي در كنترل اسكلتهاي بيروني ايجاد كند.
چكيده انگليسي
Wearable lower-limb exoskeletons traditionally face a fundamental trade-off between walking stability and energy efficiency: high-gain tracking control guarantees safety at a high mechanical cost, while compliant control saves energy at the expense of robustness. This thesis develops a deep-reinforcement-learning-based assistive controller for a six-degree-of-freedom lower-limb exoskeleton, trained with Proximal Policy Optimization (PPO) in a coupled human-exoskeleton simulation. The human wearer is modelled as a periodic, self-synchronizing gait controller built on the Hybrid Zero Dynamics framework, using Bezier-parameterized virtual constraints driven by a state-based phase variable rather than time; this construction keeps the coupled system upright and stable throughout training. The assistive policy is trained with a multi-objective reward that balances a saturated forward-velocity term, a per-joint-normalized energy penalty, a hard postural-stability constraint, and a geometric symmetry penalty. Sample efficiency and gait symmetry are further improved through mirrored-state data augmentation, and adaptation to sloped terrain is achieved through a lightweight residual-dynamics architecture that leaves the flat-ground base policy untouched. At a walking speed closely matched to the unassisted baseline (about 1.00 m/s versus 1.13 m/s), the learned policy reduces the wearerʹs mechanical cost of transport by about 14% (total cost of transport of about 7.82, of which the exoskeletonʹs own share ranges from 9.5% to 14.6% across three independent training runs), while keeping torque opposition between the wearer and the device low and preserving upright pelvis height and bilateral gait symmetry. The resulting gait recovers from external pushes of up to 150 N and converges to the same efficient policy in three of five independent training runs. These findings show that pairing a virtual-constraint-based human model with a carefully designed multi-objective reward can deliver substantial energy savings in exoskeleton control without requiring new compliant hardware.
استاد راهنما
حامد جلالي بيدگلي
استاد داور
احسان روحاني , محمدرضا احمدزاده