- Регулярные выражения — это формальный язык для описания шаблонов поиска и обработки текста. В анализе естественного языка они служат мощным инструментом для выявления определенных структур, паттернов и сущностей в тексте.
- Анализ текста:
- с помощью регулярных выражений: имён собственных (людей, городов, сёл), числовых фактов, данных (дни рождений, телефонов, адресов);
- частотный анализ.
- Подключение библиотеки регулярных выражений: import re.
- Алгоритмы:
- re.fullmatch () (проверка совпадения регулярного выражения по всей строке);
- re.search () (поиск первого совпадения в строке);
- re.sub () (замена соответствующих регулярных выражений).
- Пример. Выведите все числа, которые встречаются в строке
«’32abc67j323k534m9;».import re
text = "32abc67j323k534m9"
numbers = re.findall (r"\d+", text)
# поиск всех последовательностей цифр в строке
for num in numbers: # перебор всех найденных чисел
print ("Найдены числа:", num)
. | [abcd] | [a–z] | [^a–z] | \d | \w | \s |
|---|---|---|---|---|---|---|
Любой символ | Один из символов списка | Один из символов диапазона | Один из символов вне диапазона | Цифра | Слово | Пробел |