使用Python实现分组数据并保存到单独的文件中

 更新时间:2024年04月09日 08:17:33   作者:悬崖上的金鱼  
当处理大型数据集时,通常需要将数据分组,并将每个分组的数据保存到单独的文件中,本文将使用 Python 中的 pandas 库来实现这一目标,需要的可以参考下
(福利推荐:【腾讯云】服务器最新限时优惠活动,云服务器1核2G仅99元/年、2核4G仅768元/3年,立即抢购>>>:9i0i.cn/qcloud

(福利推荐:你还在原价购买阿里云服务器?现在阿里云0.8折限时抢购活动来啦!4核8G企业云服务器仅2998元/3年,立即抢购>>>:9i0i.cn/aliyun

Python分组数据并保存到单独的文件中

步骤 1: 导入所需的库

import os
import pandas as pd

步骤 2: 读取 Excel 数据

# 读取 Excel 数据
df = pd.read_excel("C:\\Users\\liuchunlin2\\Desktop\\新建XLSX 工作表.xlsx")

步骤 3: 根据指定字段分组数据

# 根据学校、班级、老师字段分组
grouped = df.groupby(['学校', '班级', '老师'])

步骤 4: 创建保存拆分数据的文件夹

# 新建文件夹路径
folder_path = "C:\\Users\\liuchunlin2\\Desktop\\拆分数据"
os.makedirs(folder_path, exist_ok=True)  # 检查文件夹是否存在,若不存在则创建

步骤 5: 遍历分组数据并保存到不同的 Excel 文件中

# 遍历分组,并将每个分组的数据保存到不同的 Excel 文件中
for name, group in grouped:
    school, grade, teacher = name
    filename = f"{school}_{grade}_{teacher}.xlsx"
    file_path = os.path.join(folder_path, filename)
    group.to_excel(file_path, index=False)

创建一个简单的图形用户界面,用于选择 Excel 文件并指定分组列,然后将数据按照分组保存到不同的 Excel 文件中

步骤 1: 导入所需的库

import tkinter as tk  # 导入 tkinter 模块,用于创建图形用户界面
from tkinter import filedialog  # 导入 filedialog 子模块,用于打开文件对话框
import pandas as pd  # 导入 pandas 库,用于数据处理
import os  # 导入 os 模块,用于文件和目录操作

步骤 2: 定义函数,用于打开文件对话框并选择 Excel 文件路径

def browse_file():
    # 打开文件对话框,限定文件类型为 Excel 文件 (*.xlsx)
    filepath = filedialog.askopenfilename(filetypes=[("Excel files", "*.xlsx")])
    # 清空文件路径输入框,并将选定的文件路径插入到输入框中
    file_entry.delete(0, tk.END)
    file_entry.insert(0, filepath)

步骤 3: 定义函数,用于处理数据并将其按指定列分组保存为多个 Excel 文件

def process_data():
    # 获取输入文件路径和需要分组的列名
    input_file = file_entry.get()
    group_columns = [column_entry.get() for column_entry in column_entries if column_entry.get()]

    # 检查输入是否完整
    if not input_file or not group_columns:
        result_label.config(text="Please provide input file path and group columns.")
        return

    try:
        # 读取 Excel 文件为 DataFrame,并按指定列进行分组
        df = pd.read_excel(input_file)
        grouped = df.groupby(group_columns)

        # 创建用于存储分组数据的文件夹
        folder_name = "Splitted_Data"
        if not os.path.exists(folder_name):
            os.makedirs(folder_name)

        # 将每个分组的数据保存为单独的 Excel 文件
        for name, group in grouped:
            filename = f"{folder_name}/{'_'.join(name)}.xlsx"
            group.to_excel(filename, index=False)

        result_label.config(text="Data processing completed successfully.")
    except Exception as e:
        result_label.config(text=f"Error occurred: {str(e)}")

步骤 4: 创建 tkinter 窗口对象并设置标题

root = tk.Tk()
root.title("Excel Data Grouping Tool")  # 设置窗口标题

步骤 5: 创建标签和输入框,用于显示和输入 Excel 文件路径

file_label = tk.Label(root, text="Excel File Path:")
file_label.grid(row=0, column=0, padx=5, pady=5, sticky="w")
file_entry = tk.Entry(root, width=50)
file_entry.grid(row=0, column=1, padx=5, pady=5, sticky="we")
browse_button = tk.Button(root, text="Browse", command=browse_file)
browse_button.grid(row=0, column=2, padx=5, pady=5)

步骤 6: 创建标签、输入框和按钮,用于指定分组列名

column_label = tk.Label(root, text="Group Columns:")
column_label.grid(row=1, column=0, padx=5, pady=5, sticky="w")
column_entry = tk.Entry(root, width=50)
column_entry.grid(row=1, column=1, padx=5, pady=5, sticky="we")
column_entries = [column_entry]

add_column_button = tk.Button(root, text="Add Column", command=lambda: add_column_entry())
add_column_button.grid(row=1, column=2, padx=5, pady=5)

步骤 7: 创建函数,用于添加新的分组列输入框

def add_column_entry():
    new_column_entry = tk.Entry(root, width=50)
    new_column_entry.grid(row=len(column_entries) + 1, column=1, padx=5, pady=5, sticky="we")
    column_entries.append(new_column_entry)

步骤 8: 创建按钮,用于处理数据

process_button = tk.Button(root, text="Process Data", command=process_data)
process_button.grid(row=2, column=2, padx=5, pady=10, sticky="e")  # 调整位置至右侧

步骤 9: 创建标签,用于显示处理结果信息

result_label = tk.Label(root, text="")
result_label.grid(row=len(column_entries) + 3, column=0, columnspan=3, padx=5, pady=5)

步骤 10: 启动主事件循环

root.mainloop()

完整代码

import tkinter as tk  # 导入 tkinter 模块,用于创建图形用户界面
from tkinter import filedialog  # 导入 filedialog 子模块,用于打开文件对话框
import pandas as pd  # 导入 pandas 库,用于数据处理
import os  # 导入 os 模块,用于文件和目录操作

# 定义函数,用于打开文件对话框并选择 Excel 文件路径
def browse_file():
    # 打开文件对话框,限定文件类型为 Excel 文件 (*.xlsx)
    filepath = filedialog.askopenfilename(filetypes=[("Excel files", "*.xlsx")])
    # 清空文件路径输入框,并将选定的文件路径插入到输入框中
    file_entry.delete(0, tk.END)
    file_entry.insert(0, filepath)

# 定义函数,用于处理数据并将其按指定列分组保存为多个 Excel 文件
def process_data():
    # 获取输入文件路径和需要分组的列名
    input_file = file_entry.get()
    group_columns = [column_entry.get() for column_entry in column_entries if column_entry.get()]

    # 检查输入是否完整
    if not input_file or not group_columns:
        result_label.config(text="Please provide input file path and group columns.")
        return

    try:
        # 读取 Excel 文件为 DataFrame,并按指定列进行分组
        df = pd.read_excel(input_file)
        grouped = df.groupby(group_columns)

        # 创建用于存储分组数据的文件夹
        folder_name = "Splitted_Data"
        if not os.path.exists(folder_name):
            os.makedirs(folder_name)

        # 将每个分组的数据保存为单独的 Excel 文件
        for name, group in grouped:
            filename = f"{folder_name}/{'_'.join(name)}.xlsx"
            group.to_excel(filename, index=False)

        result_label.config(text="Data processing completed successfully.")
    except Exception as e:
        result_label.config(text=f"Error occurred: {str(e)}")

# 创建 tkinter 窗口对象
root = tk.Tk()
root.title("Excel Data Grouping Tool")  # 设置窗口标题

# 创建标签和输入框,用于显示和输入 Excel 文件路径
file_label = tk.Label(root, text="Excel File Path:")
file_label.grid(row=0, column=0, padx=5, pady=5, sticky="w")
file_entry = tk.Entry(root, width=50)
file_entry.grid(row=0, column=1, padx=5, pady=5, sticky="we")
browse_button = tk.Button(root, text="Browse", command=browse_file)
browse_button.grid(row=0, column=2, padx=5, pady=5)

# 创建标签、输入框和按钮,用于指定分组列名
column_label = tk.Label(root, text="Group Columns:")
column_label.grid(row=1, column=0, padx=5, pady=5, sticky="w")
column_entry = tk.Entry(root, width=50)
column_entry.grid(row=1, column=1, padx=5, pady=5, sticky="we")
column_entries = [column_entry]

add_column_button = tk.Button(root, text="Add Column", command=lambda: add_column_entry())
add_column_button.grid(row=1, column=2, padx=5, pady=5)

# 创建函数,用于添加新的分组列输入框
def add_column_entry():
    new_column_entry = tk.Entry(root, width=50)
    new_column_entry.grid(row=len(column_entries) + 1, column=1, padx=5, pady=5, sticky="we")
    column_entries.append(new_column_entry)

# 创建按钮,用于处理数据
process_button = tk.Button(root, text="Process Data", command=process_data)
process_button.grid(row=2, column=2, padx=5, pady=10, sticky="e")  # 调整位置至右侧

# 创建标签,用于显示处理结果信息
result_label = tk.Label(root, text="")
result_label.grid(row=len(column_entries) + 3, column=0, columnspan=3, padx=5, pady=5)

# 启动主事件循环
root.mainloop()

以上就是使用Python实现分组数据并保存到单独的文件中 的详细内容,更多关于Python分组数据的资料请关注程序员之家其它相关文章!

相关文章

  • Python-numpy实现灰度图像的分块和合并方式

    Python-numpy实现灰度图像的分块和合并方式

    今天小编就为大家分享一篇Python-numpy实现灰度图像的分块和合并方式,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2020-01-01
  • pygame游戏之旅 如何制作游戏障碍

    pygame游戏之旅 如何制作游戏障碍

    这篇文章主要为大家详细介绍了pygame游戏之旅的第6篇,教大家如何制作游戏障碍,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2018-11-11
  • Python生成短uuid的方法实例详解

    Python生成短uuid的方法实例详解

    python的uuid都是32位的,比较长,处理起来效率比较低。这篇文章主要介绍了Python生成短uuid的方法,需要的朋友可以参考下
    2018-05-05
  • Python实现双进程防止单点故障实例深度探究

    Python实现双进程防止单点故障实例深度探究

    在分布式系统中,确保系统的高可用性是至关重要的,本文将深入探讨如何使用Python实现双进程自我保护机制,以应对单点故障,确保系统稳定运行,将通过详实的示例代码,介绍双进程自我保护的原理、实现步骤以及可能遇到的挑战
    2024-01-01
  • python自动化脚本安装指定版本python环境详解

    python自动化脚本安装指定版本python环境详解

    这篇文章主要为大家详细介绍了python自动化脚本安装指定版本python环境的相关方法,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2017-09-09
  • Django零基础入门之调用漂亮的HTML前端页面

    Django零基础入门之调用漂亮的HTML前端页面

    这篇文章主要介绍了Django零基础入门之调用漂亮的HTML前端页面的方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下
    2021-09-09
  • python导入csv文件出现SyntaxError问题分析

    python导入csv文件出现SyntaxError问题分析

    这篇文章主要介绍了python导入csv文件出现SyntaxError问题分析,同时涉及python导入csv文件的三种方法,具有一定借鉴价值,需要的朋友可以参考下。
    2017-12-12
  • Python中.py程序在CMD控制台以指定虚拟环境运行

    Python中.py程序在CMD控制台以指定虚拟环境运行

    本文主要介绍了Python中.py程序在CMD控制台以指定虚拟环境运行,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
    2022-07-07
  • 基于python框架Scrapy爬取自己的博客内容过程详解

    基于python框架Scrapy爬取自己的博客内容过程详解

    这篇文章主要介绍了基于python框架Scrapy爬取自己的博客内容过程详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
    2019-08-08
  • python中selenium库的基本使用详解

    python中selenium库的基本使用详解

    这篇文章主要介绍了python中selenium库的基本使用详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
    2020-07-07

最新评论

?


http://www.vxiaotou.com