1988
info:eu-repo/semantics/OpenAccess
Pierre Hubert et al., « Note sur l'approximation de la loi hypergéométrique par la formule de Muller », HAL-SHS : linguistique, ID : 10670/1.82jsm0
Le raisonnement part de l'estimation de la probabilité d'absence d'un vocable dans un échantillon exhaustif prélevé dans un corpus, connaissant la distribution des fréquences des vocables qui constituent ce corpus. C'est la formule qui a été proposée il y a plus de vingt ans par Charles Muller et qui est ici comparée avec la loi hypergéométrique. Deux applications sont examinées : le calcul de l'accroissement du vocabulaire dans des corpus et le prélèvement aléatoire d'un grand nombre d'échantillons exhaustifs sur ces corpus. On démontre ainsi, théoriquement et empiriquement, que la formule de Muller représente une bonne approximation de la loi hypergéométrique. On montre également la nécessité d'associer aux valeurs calculées un écart type qui permettra d'estimer l'intervalle de confiance attaché aux valeurs obtenues grâce à cette formule de Muller.