Profile Picture
  • All
  • Search
  • Images
  • Videos
    • Shorts
  • Maps
  • News
  • More
    • Shopping
    • Flights
  • Notebook
Report an inappropriate content
Please select one of the options below.
  • Length
    AllShort (less than 5 minutes)Medium (5-20 minutes)Long (more than 20 minutes)
  • Date
    AllPast 24 hoursPast weekPast monthPast year
  • Resolution
    AllLower than 360p360p or higher480p or higher720p or higher1080p or higher
  • Source
    All
    Dailymotion
    Vimeo
    Metacafe
    Hulu
    VEVO
    Myspace
    MTV
    CBS
    Fox
    CNN
    MSN
  • Price
    AllFreePaid
  • Clear filters
  • SafeSearch:
  • Moderate
    StrictModerate (default)Off
Filter
什么是大模型的预训练和后训练? 一视频彻底搞懂大模型预训练、SFT 监督微调、RLHF 强化学习与 DPO 直接偏好优化的底层区别与工程演进!为什么预训练出来的 Base Model 只是个资料库?DPO 如何用推导闭式解绕过独立的 Reward Model 和复杂 PPO?最全工程总结在这里!#大模型#预训练 #人工智能 #后训练 #大模型训练
1:35
什么是大模型的预训练和后训练? 一视频彻底搞懂大模型预训练、SFT 监督微调、RLHF 强化学习与 DPO 直接偏好优化的底层区别与工程演进!为什么预训练出来的 Base Model 只是个资料库?DPO 如何用推导闭式解绕过独立的 Reward Model 和复杂 PPO?最全工程总结在这里!#大模型#预训练 #人工智能 #后训练 #大模型训练
1 week ago
douyin.comAin的探索手记
See more
Static thumbnail place holder
More like this
  • Privacy
  • Terms