Papers
Topics
Authors
Recent
Search
2000 character limit reached

Predictive Diversity Score (PDS)

Updated 5 November 2025
  • Predictive Diversity Score (PDS) is a metric that quantifies statistical dissimilarity between probability distributions using a tunable parameter derived from Jensen-Shannon divergence.
  • It is constructed as a monoparametric family of metrics that ensures true metric properties for α in (0, 1/2], allowing fine control over sensitivity.
  • PDS finds practical applications in tasks such as time series segmentation and quantum state discrimination by detecting subtle changes and anomalies.

The Predictive Diversity Score (PDS) is a metric derived from the Jensen-Shannon divergence (JSD) family, designed to quantify statistical dissimilarity between probability distributions with tunable sensitivity. The PDS is constructed as a monoparametric family of metrics from the classical JSD, enabling fine-grained control over the metric properties and their sensitivity in discriminative, clustering, or segmentation tasks. The formalism supports both classical and quantum extensions and is particularly advantageous for applications involving time series segmentation, symbolic sequences, and quantum state discrimination.

1. Jensen-Shannon Divergence: Foundation for Predictive Diversity

The Jensen-Shannon divergence between two probability distributions PP and QQ over a finite alphabet is defined as

DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]

where the Kullback-Leibler divergence is DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right). Alternatively, in terms of the Shannon entropy H(P)=ipilog2piH(P) = -\sum_i p_i \log_2 p_i,

DJS(P,Q)=H(P+Q2)12H(P)12H(Q)D_{JS}(P,Q) = H\left(\frac{P+Q}{2}\right) - \frac{1}{2}H(P) - \frac{1}{2}H(Q)

JSD is symmetric, bounded, always finite, and well-defined even for zero-probability events.

2. Monoparametric Family of Metrics: Definition and Properties

The core result underpinning the PDS is the existence of a monoparametric family of distance metrics based on the JSD: dα(P,Q)=[DJS(P,Q)]αd_\alpha(P, Q) = [D_{JS}(P, Q)]^\alpha where α(0,1/2]\alpha \in (0, 1/2]. This family interpolates between JSD (α=1\alpha=1) and its square root (α=1/2\alpha=1/2), with only the latter interval producing true metrics (satisfying all four metric axioms: non-negativity, symmetry, identity of indiscernibles, and triangle inequality).

  • Metric Validity: For any QQ0, QQ1 is a metric.
  • For QQ2, QQ3 is not a metric (violates triangle inequality).
  • For QQ4, QQ5 is conjectured not to be a metric; construction of counterexamples supports this claim, though a general proof is open.

Explicitly, for distributions QQ6 and QQ7,

QQ8

with QQ9.

Summary of Metric Exponents

Exponent DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]0 Metric Property Notes
DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]1 True metric Main proven result
DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]2 Conjectured not a metric Supported by counterexamples
DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]3 Not a metric Analytically proven

3. Sensitivity and Tunability of the Predictive Diversity Score

The parameter DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]4 in the PDS allows fine control over the sensitivity of the score:

  • Lowering DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]5: Increases the magnitude and sensitivity to differences between distributions, making PDS particularly responsive to small or subtle changes.
  • Choosing DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]6: Should be based on task-specific requirements; for example, for sequence segmentation, lower values within the valid range can enhance detection performance.

This tunability is practically significant for tasks where the detection of distributional changes or anomalies is crucial and where simple pointwise distances might lack sufficient discriminative power.

4. Application to Symbolic Sequence Segmentation

In symbolic sequence segmentation, the PDS serves as a flexible statistic for detecting change-points or nonstationary behavior. The main computation involves a moving–window version of the metric:

DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]7

where DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]8, DJS(P,Q)=12[DKL(P,P+Q2)+DKL(Q,P+Q2)]D_{JS}(P, Q) = \frac{1}{2}\left[ D_{KL}\left(P, \frac{P+Q}{2} \right) + D_{KL}\left(Q, \frac{P+Q}{2} \right) \right]9 are symbol frequencies on either side of the segmentation point DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)0, and DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)1 are relative window sizes. The position maximizing DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)2 estimates the change-point.

Empirical results show that using lower DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)3 yields more pronounced segmentation statistics, providing practical guidance for parameter selection in diverse segmentation scenarios.

5. Quantum Generalization of the Predictive Diversity Score

The PDS framework extends naturally to quantum information:

  • Quantum JSD metric:

DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)4

where DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)5, DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)6, and the maximization is over all POVMs.

  • The family DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)7 defines a quantum metric for DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)8.
  • The quantum PDS thus serves as a bona fide metric for distinguishing density operators, with direct applicability to convergence testing, algorithm performance boundaries, and sensitivity analysis in quantum state space.

6. Implementation Considerations and Limitations

Computational Aspects

  • Cost: The computation involves histogram-based probability estimation and Shannon entropy evaluations; for moderate alphabet sizes or sequence segmentation, complexity scales linearly in sequence length and polynomially (linearly in most practical regimes) in alphabet size.
  • Parameter Selection: Explicit choice of DKL(P,Q)=ipilog2(piqi)D_{KL}(P, Q) = \sum_i p_i \log_2 \left(\frac{p_i}{q_i}\right)9 is critical, requiring validation or domain knowledge.
  • Domain of Applicability: While the PDS is well-defined for any pair of probability distributions on a finite alphabet, its quantum extension requires evaluation over all POVMs, which can be computationally demanding in high-dimensional Hilbert spaces.

Limitations

  • For H(P)=ipilog2piH(P) = -\sum_i p_i \log_2 p_i0: The metric fails to satisfy triangle inequality, so one loses metric-space guarantees.
  • Applications with severely limited data: Reliability of empirical probability estimates may be compromised, potentially affecting the sensitivity and stability of the PDS.

7. Significance and Impact in Statistical Data Analysis

The introduction of the Predictive Diversity Score as a monoparametric JSD-based metric offers a modular, interpretable, and tunable measure of distributional dissimilarity. It grounds applications such as symbolic sequence segmentation, detection of nonstationarity, and quantum state discrimination in a rigorous metric framework, with the advantage of tunable sensitivity. The quantum extension corroborates the general applicability of the construction to broader informational and physical contexts, including quantum information processing.

Overall, the PDS (i.e., the family H(P)=ipilog2piH(P) = -\sum_i p_i \log_2 p_i1) provides a theoretically sound, practically robust alternative to single-parameter divergences in scenarios demanding accurate, flexible quantification of statistical diversity (Osán et al., 2017).

Definition Search Book Streamline Icon: https://streamlinehq.com
References (1)

Topic to Video (Beta)

No one has generated a video about this topic yet.

Whiteboard

No one has generated a whiteboard explanation for this topic yet.

Follow Topic

Get notified by email when new papers are published related to Predictive Diversity Score (PDS).