How to add/append a row to a particular partition in the dask dataframe?(如何将行添加/追加到DaskDataFrame中的特定分区?)
本文介绍了如何将行添加/追加到DaskDataFrame中的特定分区?的处理方法,对大家解决问题具有一定的参考价值,需要的朋友们下面随着小编来一起学习吧!
问题描述
我想将一行追加到DaskDataFrames中的特定分区。我试过很多方法,但没有一个是可行的。有人能帮我这个忙吗。提前感谢
我试过-
first_partition = df.partitions[0]
new_dd = first_partiton.append(row)
df.partitions[0] = new_dd
这不起作用
我甚至尝试使用map_artitions(),但即使是这个函数也不能真正帮助获取分区的元数据来修改特定分区。
是否可以将数据帧保存为拼图文件,然后只修改特定的拼图文件并将其保存回来?-我尝试了这个方法,但似乎也不起作用。
推荐答案
使用map_partitions可以修改该特定分区。
然后通过切换到延迟对象来替换数据帧中已修改的分区来创建新帧,将延迟对象替换到列表中,然后切换回DaskDataFrame。
def append_row_dict(df, row_dict):
small_df = pd.DataFrame(row_dict)
return df.append(small_df)
p_df = pd.DataFrame({'a':np.arange(0,10)})
dask_df = dd.from_pandas(p_df,npartitions=4)
part_to_change = 1
new_partion = dask_df.get_partition(part_to_change).map_partitions(append_row_dict,{'a':[-1]})
list_of_delayed = dask_df.to_delayed()
## we only have 1 delayed object for 1 partition
assert new_partion.npartitions==1
list_of_delayed[part_to_change]=new_partion.to_delayed()[0]
new_dask_df = dd.from_delayed(list_of_delayed, meta=dask_df._meta)
new_dask_df.get_partition(part_to_change).compute()
a
3 3
4 4
5 5
0 -1
这篇关于如何将行添加/追加到DaskDataFrame中的特定分区?的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,也希望大家多多支持编程学习网!
沃梦达教程
本文标题为:如何将行添加/追加到DaskDataFrame中的特定分区?
基础教程推荐
猜你喜欢
- PANDA VALUE_COUNTS包含GROUP BY之前的所有值 2022-01-01
- 无法导入 Pytorch [WinError 126] 找不到指定的模块 2022-01-01
- 在同一图形上绘制Bokeh的烛台和音量条 2022-01-01
- 修改列表中的数据帧不起作用 2022-01-01
- Plotly:如何设置绘图图形的样式,使其不显示缺失日期的间隙? 2022-01-01
- 包装空间模型 2022-01-01
- PermissionError: pip 从 8.1.1 升级到 8.1.2 2022-01-01
- 在Python中从Azure BLOB存储中读取文件 2022-01-01
- 求两个直方图的卷积 2022-01-01
- 使用大型矩阵时禁止 Pycharm 输出中的自动换行符 2022-01-01
