如何更新nltk包,使其不会将电子邮件分解为3个不同的令牌?

How to update nltk package so that it does not break email into 3 different tokens?(如何更新nltk包,使其不会将电子邮件分解为3个不同的令牌?)
本文介绍了如何更新nltk包,使其不会将电子邮件分解为3个不同的令牌?的处理方法,对大家解决问题具有一定的参考价值,需要的朋友们下面随着小编来一起学习吧!

问题描述

当我键入以下代码时: tokens = word_tokenize("a@b.com")

它分为以下3个标记:‘a’、‘@’、‘b.com’

我想做的是将其保留为单个令牌‘a@b.com’。

推荐答案

免责声明:有很多电子邮件正则表达式。我并没有尝试匹配此问题中的所有电子邮件格式,只是显示了一个示例

使用RegexpTokenizer(mentioned abovebylenz)的正则表达式方法可以工作:

from nltk.tokenize.regexp import RegexpTokenizer
line="My email: a@bc.com is not accessible."
pattern = r'S+@[^s.]+.[a-zA-Z]+|w+|[^ws]'
tokeniser=RegexpTokenizer(pattern)
tokeniser.tokenize(line)
# => ['My', 'email', ':', 'a@bc.com', 'is', 'not', 'accessible', '.']

正则表达式匹配:

  • S+@[^s.]+.[a-zA-Z]+-文本看起来像电子邮件:
    • S+-1个或更多非空格字符
    • @-a@符号
    • [^s.]+-1个或更多除空格和.以外的字符
    • .-文字点
    • [a-zA-Z]+-1个或更多ASCII字母
  • |-或
  • w+-1个或多个单词字符(字母、数字或下划线)
  • |-或
  • [^ws]-单词和空格字符以外的单个字符(在其后面添加+以匹配1或更多的序列)。

请参阅online regex demo。

这篇关于如何更新nltk包,使其不会将电子邮件分解为3个不同的令牌?的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,也希望大家多多支持编程学习网!

本站部分内容来源互联网,如果有图片或者内容侵犯您的权益请联系我们删除!

相关文档推荐

Leetcode 234: Palindrome LinkedList(Leetcode 234:回文链接列表)
How do I read an Excel file directly from Dropbox#39;s API using pandas.read_excel()?(如何使用PANDAS.READ_EXCEL()直接从Dropbox的API读取Excel文件?)
subprocess.Popen tries to write to nonexistent pipe(子进程。打开尝试写入不存在的管道)
I want to realize Popen-code from Windows to Linux:(我想实现从Windows到Linux的POpen-code:)
Reading stdout from a subprocess in real time(实时读取子进程中的标准输出)
How to call type safely on a random file in Python?(如何在Python中安全地调用随机文件上的类型?)