• شماره مدرك
    21261
  • شماره راهنما
    18205
  • پديد آورنده

    هشام صالح المنصور، سلوان

  • عنوان

    يادگيري گشتاور متقارن كمكي براي اسكلت‌هاي بيروني پايين‌تنه با استفاده از يادگيري تقويتي عميق

  • مقطع تحصيلي
    كارشناسي ارشد
  • گرايش تحصيلي
    بيو الكترونيك
  • محل تحصيل
    اصفهان : دانشگاه صنعتي اصفهان
  • سال دفاع
    1405
  • صفحه شمار
    55 ص.
  • توصيفگر ها

    - اسكلت بيروني دوپا، - يادگيري تقويتي عميق، - بهينه‌سازي مصرف انرژي، - ديناميك صفر تركيبي، - كنترل متقارن

  • تاريخ ورود اطلاعات
    1405/07/01
  • كتابنامه
    كتابنامه
  • رشته تحصيلي
    مهندسي پزشكي
  • دانشكده
    مهندسي برق و كامپيوتر
  • تاريخ ويرايش اطلاعات
    1405/07/01
  • كد ايرانداك
    23253632
  • چكيده فارسي
    اسكلت‌هاي بيروني پوشيدني اندام تحتاني به‌طور سنتي با يك تعارض بنيادين ميان پايداري راه‌رفتن و بازدهي مصرف انرژي مواجه‌اند: كنترل رديابي با بهره بالا ايمني را تضمين مي‌كند اما هزينه مكانيكي بالايي دارد، در حالي كه كنترل تطبيق‌پذير انرژي را كاهش مي‌دهد اما مقاوم‌بودن سامانه را به خطر مي‌اندازد. در اين پايان‌نامه، يك كنترل‌كننده كمكي مبتني بر يادگيري تقويتي عميق براي يك اسكلت بيروني شش‌مفصلي اندام تحتاني توسعه داده شده است كه با الگوريتم بهينه‌سازي سياست پروگزيمال (PPO) در يك شبيه‌سازي جفت‌شده انسان-اسكلت‌بيروني آموزش مي‌بيند. كاربر انساني به‌صورت يك كنترل‌كننده راه‌رفتن متناوب و خودهمگام‌شونده، مبتني بر چارچوب ديناميك صفر تركيبي و قيدهاي مجازي بيزيه با فاز وابسته به حالت سامانه، مدل‌سازي شده است؛ رويكردي كه سامانه جفت‌شده را در سراسر آموزش پايدار نگه مي‌دارد. سياست كمكي با يك تابع پاداش چندهدفه آموزش مي‌بيند كه ميان سرعت پيشروي اشباع‌شده، جريمه انرژي نرمال‌شده به تفكيك هر مفصل، قيد سخت پايداري وضعيتي، و جريمه تقارن هندسي توازن برقرار مي‌كند. براي بهبود كارايي نمونه و تقويت الگوي راه‌رفتن متقارن، از افزايش داده مبتني بر حالت‌هاي آينه‌شده استفاده شده و سازگاري با زمين‌هاي شيب‌دار از طريق يك معماري ديناميك پسماند سبك‌وزن، بدون بازآموزي سياست پايه، محقق شده است. نتايج نشان مي‌دهند كه در سرعتي نزديك به سرعت راه‌رفتن بدون كمك (حدود 1 متر بر ثانيه در برابر 1/13 متر بر ثانيه)، سياست آموخته‌شده هزينه حمل‌ونقل مكانيكي كاربر را حدود 14 درصد كاهش مي‌دهد (هزينه حمل‌ونقل كل نزديك به 7/82، كه سهم اسكلت بيروني از آن در سه اجراي مستقل آموزش بين 9/5 تا 14/6 درصد متغير است)، در حالي كه تقابل گشتاور ميان كاربر و دستگاه پايين، و ارتفاع طبيعي لگن و تقارن دوطرفه گام‌برداري حفظ مي‌شوند. الگوي حاصل در برابر اغتشاش‌هاي بيروني تا 150 نيوتن مقاوم است و در سه از پنج اجراي مستقل آموزش به سياستي يكسان و كارآمد همگرا مي‌شود. اين پژوهش نشان مي‌دهد كه تركيب يك مدل كاربر مبتني بر قيد مجازي با يك پاداش چندهدفه به‌دقت طراحي‌شده، مي‌تواند بدون نياز به سخت‌افزار انطباق‌پذير جديد، بازدهي انرژي قابل‌توجهي در كنترل اسكلت‌هاي بيروني ايجاد كند.
  • چكيده انگليسي
    Wearable lower-limb exoskeletons traditionally face a fundamental trade-off between walking stability an‎d energy efficiency: high-gain tracking control guarantees safety at a high mechanical cost, while compliant control saves energy at the expense of robustness. This thesis develops a deep-reinforcement-learning-based assistive controller for a six-degree-of-freedom lower-limb exoskeleton, trained with Proximal Policy Optimization (PPO) in a coupled human-exoskeleton simulation. The human wearer is modelled as a periodic, self-synchronizing gait controller built on the Hybrid Zero Dynamics framework, using Bezier-parameterized virtual constraints driven by a state-based phase variable rather than time; this construction keeps the coupled system upright an‎d stable throughout training. The assistive policy is trained with a multi-objective reward that balances a saturated forward-velocity term, a per-joint-normalized energy penalty, a hard postural-stability constraint, an‎d a geometric symmetry penalty. Sample efficiency an‎d gait symmetry are further improved through mirrored-state data augmentation, an‎d adaptation to sloped terrain is achieved through a lightweight residual-dynamics architecture that leaves the flat-ground base policy untouched. At a walking speed closely matched to the unassisted baseline (about 1.00 m/s versus 1.13 m/s), the learned policy reduces the wearerʹs mechanical cost of transport by about 14% (total cost of transport of about 7.82, of which the exoskeletonʹs own share ranges from 9.5% to 14.6% across three independent training runs), while keeping torque opposition between the wearer an‎d the device low an‎d preserving upright pelvis height an‎d bilateral gait symmetry. The resulting gait recovers from external pushes of up to 150 N an‎d converges to the same efficient policy in three of five independent training runs. These findings show that pairing a virtual-constraint-based human model with a carefully designed multi-objective reward can deliver substantial energy savings in exoskeleton control without requiring new compliant hardware.
  • استاد راهنما
    حامد جلالي بيدگلي
  • استاد داور
    احسان روحاني , محمدرضا احمدزاده