龙盟编程博客 | 无障碍搜索 | 云盘搜索神器
快速搜索
主页 > web编程 > python编程 >

python中正则表达式的使用详解

时间:2014-10-18 12:11来源:网络整理 作者:网络 点击:
分享到:
这篇文章主要介绍了python中正则表达式的使用详解,另附上一些常用的Python正则例子,有需要的朋友可以参考下

从学习Python至今,发现很多时候是将Python作为一种工具。特别在文本处理方面,使用起来更是游刃有余。

说到文本处理,那么正则表达式必然是一个绝好的工具,它能将一些繁杂的字符搜索或者替换以非常简洁的方式完成。

我们在处理文本的时候,或是查询抓取,或是替换.

一.查找
如果你想自己实现这样的功能模块,输入某一个ip地址,得到这个ip地址所在地区的详细信息.

然后你发现http://ip138.com 可以查出很详细的数据

但是人家没有提供api供外部调用,但是我们可以通过代码模拟查询然后对结果进行抓取.

通过查看这个相应页面的源码,我们可以发现,结果是放在三个<li></li>中的

复制代码 代码如下:

<table width="80%"  border="0" align="center" cellpadding="0" cellspacing="0"> 
    <tr> 
        <td align="center"><h3>ip138.com IP查询(搜索IP地址的地理位置)</h3></td> 
    </tr> 
    <tr> 
        <td align="center"><h1>您查询的IP:121.0.29.231</h1></td> 
    </tr> 
    <tr> 
 
        <td align="center"><ul class="ul1"><li>本站主数据:浙江省杭州市 阿里巴巴</li><li>参考数据一:浙江省杭州市 阿里巴巴</li><li>参考数据二:浙江省杭州市 阿里巴巴</li></ul></td> 
    </tr> 
    <tr> 
        <td align="center">如果您发现查询结果不详细或不正确,请使用<a href="ip_add.asp?ip=121.0.29.231"><font color="#006600"><b>IP数据库自助添加</b></font></a>功能进行修正<br/><br/> 
        <iframe src="/jss/bd_460x60.htm" frameborder="no" width="460" height="60" border="0" marginwidth="0" marginheight="0" scrolling="no"></iframe><br/><br/></td> 
 
    </tr> 
    <form method="get" action="ips8.asp" name="ipform" onsubmit="return checkIP();"> 
    <tr> 
        <td align="center">IP地址或者域名:<input type="text" name="ip" size="16"> <input type="submit" value="查询"><input type="hidden" name="action" value="2"></td> 
    </tr><br> 
<br> 
    </form> 
</table>   

如果你了解正则表达式你可能会写出

正则表达式

复制代码 代码如下:

(?<=<li>).*?(?=</li>)

这里使用了前瞻:lookahead 后顾: lookbehind,这样的好处就是匹配的结果中就不会包含html的li标签了.

如果你对自己写的正则表达式不是很自信的话,可以在一些在线或者本地的正则测试工具进行一些测试,以确保正确.

接下来的工作就是如果用Python实现这样的功能,首先我们得将正则表达式表示出来:

复制代码 代码如下:

r"(?<=<li>).*?(?=</li>)" 

 Python中字符串前面加上前导r这个字符,代表这个字符串是R aw String(原始字符串),也就是说Python字符串本身不会对字符串中的字符进行转义.这是因为正则表达式也有转义字符之说,如果双重转义的话,易读性很差.

这样的串在Python中我们把它叫做"regular expression pattern"

如果我们对pattern进行编译的话

复制代码 代码如下:

prog = re.compile(r"(?<=<li>).*?(?=</li>)") 

我们便可以得到一个正则表达式对象regular expression object,通过这个对象我们可以进行相关操作.

比如

精彩图集

赞助商链接