Maîtrisez le protocole d'itération et les générateurs pour traiter des flux de données paresseusement, à mémoire constante.
Ouvrir cette leçon dans KodokonLe for de Python n'est qu'un protocole : iter(obj) demande un itérateur, puis next() est appelé jusqu'à l'exception StopIteration. Distinguez bien l'itérable (la liste, capable de fournir un itérateur neuf à chaque parcours) de l'itérateur (le curseur, qui ne se parcourt qu'une seule fois). Comprendre ce protocole, c'est comprendre pourquoi certains objets « se consomment ».
numbers = [10, 20, 30]
iterator = iter(numbers)
print(next(iterator))
print(next(iterator))
print(next(iterator))
# next(iterator) lèverait StopIterationUne fonction qui contient yield ne s'exécute pas à l'appel : elle retourne un générateur, un itérateur dont le corps s'exécute à la demande. Chaque next() avance jusqu'au yield suivant, où l'exécution est suspendue avec tout son état local. Conséquence directe : la mémoire reste constante quelle que soit la taille du flux - vous produisez les valeurs une par une au lieu de matérialiser une liste complète.
def squares(limit):
n = 0
while n < limit:
yield n * n
n += 1
gen = squares(4)
print(next(gen)) # 0
print(list(gen)) # [1, 4, 9]L'intérêt majeur en production : les pipelines. Chaque étape consomme le flux de la précédente et produit le sien, paresseusement ; rien ne s'exécute avant la consommation finale (list(), sum(), un for). Compromis à connaître : une liste se parcourt plusieurs fois et se découpe en tranches, un générateur non ; en revanche, le générateur traite un fichier de 10 Go sans saturer la RAM. Les expressions génératrices - (f(x) for x in xs if cond) - couvrent les étapes simples sans définir de fonction.
lines = [" 12 ", "x", " 7", "", "30"]
def clean(rows):
for row in rows:
row = row.strip()
if row.isdigit():
yield int(row)
def keep_from(values, floor):
return (v for v in values if v >= floor)
pipeline = keep_from(clean(lines), 10)
print(list(pipeline)) # [12, 30]