Machine learning e IA · Inteligencia Artificial

Aprendizaje por Refuerzo y Procesos de Decisión de Markov

Introducción pública · guía completa en Eikos

Introducción

De qué trata esta guía

☰ // Control Óptimo Estocástico · Inteligencia Artificial

Recorrido

Temas que aborda

  • Introducción
  • Introducción y el Paradigma de Aprendizaje por Refuerzo
  • Procesos de Markov
  • Procesos de Markov Estacionarios
  • Distribuciones Estacionarias
  • Estructura Matemática del MDP

Conceptos relacionados

Conexiones principales

  • montecarlo
  • varianza
  • calculo
  • esperanza
  • algebra
  • bootstrap

Notación compatible

Muestra matemática en LaTeX

La expresión se renderiza de forma accesible y conserva debajo su fuente LaTeX.

τ=(S0,A0,R1,S1,A1,R2,,St1,At1,Rt,St)\tau = (S_0, A_0, R_1, S_1, A_1, R_2, \dots, S_{t-1}, A_{t-1}, R_t, S_t)
Ver LaTeX fuente\tau = (S_0, A_0, R_1, S_1, A_1, R_2, \dots, S_{t-1}, A_{t-1}, R_t, S_t)