Two exact probability vectors can be compared by the selected true-class probability while the log losses remain named.

highlighted = computed this step

Two candidate distributions

Use the same one-hot target for both candidates. The left distribution selects 1/2; the right distribution selects 1/4.

ptrue,left=1/2,ptrue,right=1/4p_{\text{true,left}}=1/2,\quad p_{\text{true,right}}=1/4
Cross-entropy candidate comparisonOne target compares two exact probability vectors.compare by true-class probabilitycandidatep vectorp_truenamed losscomparisonleft(1/4, 1/2, 1/4)1/2-log(1/2)larger p_trueright(1/2, 1/4, 1/4)1/4-log(1/4)smaller p_truetarget=B; 1/2 > 1/4, so -log(1/2) is better than -log(1/4)comparison uses exact probabilities; log values stay namedexact one-hot selection plus named log boundary; one loss on one pinned probabilitydistribution; NOT learning

Compare without log decimals

1/2 is greater than 1/4, so -log(1/2) is better than -log(1/4) for this one target.

1/2>1/4log(1/2) better than log(1/4)1/2>1/4\Rightarrow -\log(1/2)\text{ better than }-\log(1/4)
Cross-entropy candidate comparisonOne target compares two exact probability vectors.compare by true-class probabilitycandidatep vectorp_truenamed losscomparisonleft(1/4, 1/2, 1/4)1/2-log(1/2)larger p_trueright(1/2, 1/4, 1/4)1/4-log(1/4)smaller p_truetarget=B; 1/2 > 1/4, so -log(1/2) is better than -log(1/4)comparison uses exact probabilities; log values stay namedexact one-hot selection plus named log boundary; one loss on one pinned probabilitydistribution; NOT learning

Summary

The comparison ranks two pinned probability vectors for one example only. The log losses stay named, not decimalized.

rank by exact ptrue; log remains named\text{rank by exact }p_{\text{true}}\text{; log remains named}
Cross-entropy candidate comparisonOne target compares two exact probability vectors.compare by true-class probabilitycandidatep vectorp_truenamed losscomparisonleft(1/4, 1/2, 1/4)1/2-log(1/2)larger p_trueright(1/2, 1/4, 1/4)1/4-log(1/4)smaller p_truetarget=B; 1/2 > 1/4, so -log(1/2) is better than -log(1/4)comparison uses exact probabilities; log values stay namedexact one-hot selection plus named log boundary; one loss on one pinned probabilitydistribution; NOT learning