Description
Este livro descreve o efeito de vrios factores, como a taxa de aprendizagem, o fator de desconto e o epsilon, na capacidade de treino do drone para navegar da origem ao destino. O valor mais elevado da taxa de aprendizagem incentiva a aprendizagem rpida do drone, mas existe o risco de oscilao em vez de convergncia e, para o valor mais baixo da taxa de aprendizagem, o drone aprende lentamente, mas converge de forma constante. Este livro centra-se principalmente na implementao dos algoritmos de RL para reas mais pequenas. Para reas complexas maiores, estes algoritmos so menos eficientes, pelo que a aprendizagem por reforo profundo pode ser utilizada no futuro para tornar o UAV mais eficiente para a implementao no mundo real.




