Skip to main navigation Skip to search Skip to main content

Properties of Turnpike Functions for Discounted Markov Decision Processes

  • University of California at San Diego

Research output: Contribution to conferencePaperpeer-review

Abstract

This paper studies discounted Markov Decision Processes (MDPs) with finite sets of states and actions. Value iteration is one of the major methods for finding optimal policies. For each discount factor, starting from a finite number of iterations, which is called the turnpike integer, value iteration algorithms always generate decision rules which are deterministic optimal policies for the infinite-horizon problems. This fact justifies the rolling horizon approach for computing infinite-horizon optimal policies by conducting a finite number of value iterations. This paper describes properties of turnpike integers and provides their upper bounds.

Original languageEnglish
Pages23-30
Number of pages8
DOIs
StatePublished - 2025
Event2025 SIAM Conference on Control and Its Applications, CT 2025 - Montreal, Canada
Duration: Jul 28 2025Jul 30 2025

Conference

Conference2025 SIAM Conference on Control and Its Applications, CT 2025
Country/TerritoryCanada
CityMontreal
Period07/28/2507/30/25

Fingerprint

Dive into the research topics of 'Properties of Turnpike Functions for Discounted Markov Decision Processes'. Together they form a unique fingerprint.

Cite this