06-python-numpy-genfromtxt
6. NumPy之:使用genfromtxt导入数据
简介
在做科学计算的时候,我们需要从外部加载数据,今天给大家介绍一下NumPy中非常有用的一个方法genfromtxt。genfromtxt可以分解成两步,第一步是从文件读取数据,并转化成为字符串。第二步就是将字符串转化成为指定的数据类型。
genfromtxt介绍
先看下genfromtxt的定义:
numpy.genfromtxt(fname, dtype=<class 'float'>, comments='#', delimiter=None, skip_header=0, skip_footer=0, converters=None, missing_values=None, filling_values=None, usecols=None, names=None, excludelist=None, deletechars=" !#$%&'()*+, -./:;<=>?@[\]^{|}~", replace_space='_', autostrip=False, case_sensitive=True, defaultfmt='f%i', unpack=None, usemask=False, loose=True, invalid_raise=True, max_rows=None, encoding='bytes')genfromtxt可以接受多个参数,这么多参数中只有fname是必须的参数,其他的都是可选的。
fname可以有多种形式,可以是file, str, pathlib.Path, list of str, 或者generator。
如果是单独的str,那么默认是本地或者远程文件的名字。如果是list of str,那么每个str都被当做文件中的一行数据。如果传入的是远程的文件,这个文件会被自动下载到本地目录中。
genfromtxt还可以自动识别文件是否是压缩类型,目前支持两种压缩类型:gzip 和 bz2。
接下来我们看下genfromtxt的常见应用:
使用之前,通常需要导入两个库:
from io import StringIO
import numpy as npStringIO会生成一个String对象,可以作为genfromtxt的输入。
我们先定义一个包含不同类型的StringIO:
这个StringIO包含一个int,一个float和一个str。并且分割符是 ,。
我们看下genfromtxt最简单的使用:
因为默认的分隔符是delimiter=None,所以StringIO中的数据会被作为一个整体转换成数组,结果就是nan。
下面我们添加一个逗号分割符:
这次有输出了,但是最后一个字符串因为不能被转换成为float,所以得到了nan。
注意,我们第一行需要重置StringIO的指针到文件的开头。这里我们使用 s.seek(0)。
那么怎么把最后一个str也进行转换呢?我们需要手动指定dtype:
上面我们指定了所有的数组类型都是float,我们还可以分别为数组的每个元素指定类型:
我们分别使用int,float和str来对文件中的类型进行转换,可以看到得到了正确的结果。
除了指定类型,我们还可以指定名字,上面的例子中,我们没有指定名字,所以使用的是默认的f0,f1,f2。看一个指定名字的例子:
分隔符除了使用字符之外,还可以使用index:
上面我们使用index作为s的分割。
多维数组
如果数据中有换行符,那么可以使用genfromtxt来生成多维数组:
autostrip
使用autostrip 可以删除数据两边的空格:
comments
默认的comments 是 # ,数据中所有以# 开头的都被看做是注释。
跳过行和选择列
可以使用skip_header 和 skip_footer 来跳过返回的数组特定的行:
可以使用usecols 来选择特定的行数:
如果列还有名字的话,可以用usecols 来选择列的名字:
本文已收录于 www.flydean.com
最通俗的解读,最深刻的干货,最简洁的教程,众多你不知道的小技巧等你来发现!
欢迎关注我的公众号:「程序那些事」,懂技术,更懂你!
最后更新于
这有帮助吗?