TrendHackergeeknews intel
live
← 위키 인덱스
WIKI · 태그 · Concept · 7일 등장
강화학습RLTrainingITAI 에이전트LLM파인튜닝벤치마크프롬프트 엔지니어링

강화학습

종류: Concept · 등장 7일

정의: 보상 신호로 행동 정책을 학습하는 방법. RLHF로 LLM 정렬에도 쓰인다

강화학습은 보상 신호를 이용해 행동 정책을 학습하는 머신러닝 방법이며, RLHF를 통해 대형 언어 모델의 정렬에도 적용된다. 최근에는 LLM 성능 최적화와 PACER 기술, AI 에이전트 및 멀티모달 모델 고도화와 함께 자주 언급되며, 트레이닝, 파인튜닝, 프롬프트 엔지니어링 등과 공출현이 증가하고 있다.

등장한 날

  • 2026-08-26 — 트렌드 스냅샷
  • 2026-08-20 — 트렌드 스냅샷
  • 2026-08-12 — AI 에이전트의 시각적 Grounding 및 강화학습 기반…
  • 2026-08-09 — 터미널 기반 CLI 도구와 AI 코딩 구독 모델의 확산
  • 2026-07-29 — AI 에이전트 중심의 기술 생태계 확장과 모델 최적화 연구
  • 2026-07-23 — LLM 성능 최적화와 PACER 기술을 통한 모델 추론 및…
  • 2026-07-22 — AI 에이전트와 강화학습 기반의 추론 및 멀티모달 모델 고도화

상위/하위 토픽

공출현 이웃

RL · Training · IT · AI 에이전트 · LLM · 파인튜닝 · 벤치마크 · 프롬프트 엔지니어링