当前位置:首页 > 科技  > 软件

Python 制作微博抓取 GUI 程序

来源: 责编: 时间:2023-10-30 17:24:44 385观看
导读在前面的分享中,我们制作了一个天眼查 GUI 程序,今天我们在这个的基础上,继续开发新的功能,微博抓取工具,先来看下最终的效果图片整体的界面还是继承自上次的天眼查界面,我们直接来看相关功能微博功能布局我们整体的界面布

在前面的分享中,我们制作了一个天眼查 GUI 程序,今天我们在这个的基础上,继续开发新的功能,微博抓取工具,先来看下最终的效果1D228资讯网——每日最新资讯28at.com

图片图片1D228资讯网——每日最新资讯28at.com

整体的界面还是继承自上次的天眼查界面,我们直接来看相关功能1D228资讯网——每日最新资讯28at.com

微博功能布局

我们整体的界面布局就是左侧可以选择不同功能,然后右侧的界面会对应改变1D228资讯网——每日最新资讯28at.com

创建微博 Widget

对于右侧界面的切换,我们可以为不同的功能创建不同的 Widget,当点击左侧不同功能按钮后,对应切换 Widget 即可1D228资讯网——每日最新资讯28at.com

我们新建一个 weibo 相关的函数,主要用来界面布局1D228资讯网——每日最新资讯28at.com

def weiboWidget(self):    self.left_button_widget_3 = QtWidgets.QWidget()    self.weiboWebEngine = QWebEngineView()    self.weiboWebEngine2 = QWebEngineView()    self.progressWidget = QtWidgets.QWidget()    self.ciyunWidget = QtWidgets.QWidget()

我们还看到整体界面有一个词云,该词云是通过 matplotlib 渲染的,所以还需要创建 matplotlib 布局1D228资讯网——每日最新资讯28at.com

# matplotlib 绘图区域self.figure = plt.figure(figsize=(7, 2))self.canvas = FigureCanvasQTAgg(self.figure)  # 绘图区域放到图层canvas之中self.gridLayout_weibo.addWidget(self.canvas, 5, 0, 1, 9)  # 图层放到pyqt布局之中

创建微博查询

接下来我们创建一个微博查询函数,同时因为我们这里需要实时更新抓取进度条,所以使用了多线程的方式1D228资讯网——每日最新资讯28at.com

def doWeiboQuery(self):    weibo_link = self.lineEdit_weibo_link.text()    weibo_name = self.lineEdit_weibo_name.text()    weibo_page = self.weibo_comboBox.currentText()    if not weibo_link or not weibo_name:        QMessageBox.information(self, "Error", "微博链接或者用户名称不能为空",                                QMessageBox.Yes)        return    self.weiboWebEngine.load(QUrl(weibo_link))    self.qth = WeiBoQueryThread()    self.qth.update_data.connect(self.weiboPgbUpdate)    self.qth.draw_ciyun.connect(self.drawCiyun)    self.qth.weibo_page = weibo_page    self.qth.weibo_link = weibo_link    self.qth.weibo_name = weibo_name    self.qth.start()

而主线程与子线程之间的通信,是使用信号槽的形式1D228资讯网——每日最新资讯28at.com

def weiboPgbUpdate(self, data):    self.pgb.setValue(data)def drawCiyun(self):    self.canvas.draw()    self.toolbar = NavigationToolbar2QT(self.canvas, self)    self.gridLayout_weibo.addWidget(self.toolbar, 8, 0, 1, 9)

接下来就是创建子进程函数,函数主体是爬取微博的代码1D228资讯网——每日最新资讯28at.com

"""子进程微博查询"""class WeiBoQueryThread(QThread):    # 创建一个信号,触发时传递当前时间给槽函数    update_data = pyqtSignal(int)    draw_ciyun = pyqtSignal()    weibo_name = None    weibo_link = None    weibo_page = None    total_pv = 0    timestamp = str(int(time.time()))    def run(self):        # 微博爬虫        try:            file_name = self.weibo_name + "_" + self.timestamp + 'comment.csv'            my_weibo = weibo_interface.Weibo(self.weibo_name)            uid, blog_info = my_weibo.weibo_info(self.weibo_link)            pv_max = int(self.weibo_page)            pre_pv = 100 // pv_max            for i in range(int(self.weibo_page)):                my_weibo.weibo_comment(uid, blog_info, str(i), file_name)                self.total_pv += pre_pv                self.update_data.emit(self.total_pv)            print("所有微博评论爬取完成!")            print("开始生成词云")            font, img_array, STOPWORDS, words = ciyun(file_name)            wc = WordCloud(width=2000, height=1800, background_color='white', font_path=font, mask=img_array,                           stopwords=STOPWORDS, contour_width=3, contour_color='steelblue').generate(words)            plt.imshow(wc)            plt.axis("off")            self.draw_ciyun.emit()            print("生成词云完成")        except Exception as e:            print(e)

而对于微博的具体爬取方法,这里就不再展开说明了,我是把所有微博爬虫的代码都封装好了,这里直接调用暴露的接口即可1D228资讯网——每日最新资讯28at.com

词云制作

对于词云的制作,我们还是先通过 jieba 进行分词处理,然后使用 wordcloud 库生成词云即可1D228资讯网——每日最新资讯28at.com

# 词云相关def ciyun(file, without_english=True):    font = r'C:/Windows/Fonts/FZSTK.TTF'    STOPWORDS = {"回复", "@", "我", "她", "你", "他", "了", "的", "吧", "吗", "在", "啊", "不", "也", "还", "是",                 "说", "都", "就", "没", "做", "人", "赵薇", "被", "不是", "现在", "什么", "这", "呢", "知道", "邓"}    df = pd.read_csv(file, usecols=[0])    df_copy = df.copy()    df_copy['comment'] = df_copy['comment'].apply(lambda x: str(x).split())  # 去掉空格    df_list = df_copy.values.tolist()    comment = jieba.cut(str(df_list), cut_all=False)    words = ' '.join(comment)    if without_english:        words = re.sub('[a-zA-Z]', '', words)    img = Image.open('ciyun.png')    img_array = np.array(img)    return font, img_array, STOPWORDS, words

由于很多评论当中会存在链接信息,导致制作的词云有很多高权重的英文字符,所有这里也通过正则进行了去英文字符处理。1D228资讯网——每日最新资讯28at.com

至此,我们这个微博查询功能就完成了~1D228资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-26-15886-0.htmlPython 制作微博抓取 GUI 程序

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 接口请求重试的八种方法,你用哪种?

下一篇: Nacos注册中心有几种调用方式?

标签:
  • 热门焦点
  • 鸿蒙OS 4.0公测机型公布:甚至连nova6都支持

    华为全新的HarmonyOS 4.0操作系统将于今天下午正式登场,官方在发布会之前也已经正式给出了可升级的机型产品,这意味着这些机型会率先支持升级享用。这次的HarmonyOS 4.0支持
  • 红魔电竞平板评测:大屏幕硬实力

    前言:三年的疫情因为要上网课的原因激活了平板市场,如今网课的时代已经过去,大家的生活都恢复到了正轨,这也就意味着,真正考验平板电脑生存的环境来了。也就是面对着这种残酷的
  • Redmi Buds 4开箱简评:才199还有降噪 可以无脑入

    在上个月举办的Redmi Note11T Pro系列新机发布会上,除了两款手机新品之外,Redmi还带来了两款TWS真无线蓝牙耳机产品,Redmi Buds 4和Redmi Buds 4 Pro,此前我们在Redmi Note11T
  • 6月安卓手机性能榜:vivo/iQOO霸占旗舰排行榜前三

    2023年上半年已经正式过去了,我们也迎来了安兔兔V10版本,在新的骁龙8Gen3和天玑9300发布之前,性能榜的榜单大体会以骁龙8Gen2和天玑9200+为主,至于那颗3.36GHz的骁龙8Gen2领先
  • 帅气纯真少年!日本最帅初中生选美冠军出炉

    日本第一帅哥初一生选美大赛冠军现已正式出炉,冠军是来自千叶县的宗田悠良。日本一直热衷于各种选美大赛,从“最美JK”起到“最美女星&r
  • 把LangChain跑起来的三个方法

    使用LangChain开发LLM应用时,需要机器进行GLM部署,好多同学第一步就被劝退了,那么如何绕过这个步骤先学习LLM模型的应用,对Langchain进行快速上手?本片讲解3个把LangChain跑起来
  • 让我们一起聊聊文件的操作

    文件【1】文件是什么?文件是保存数据的地方,是数据源的一种,比如大家经常使用的word文档、txt文件、excel文件、jpg文件...都是文件。文件最主要的作用就是保存数据,它既可以保
  • 这款新兴工具平台,让你的电脑效率翻倍

    随着信息技术的发展,我们获取信息的渠道越来越多,但是处理信息的效率却成为一个瓶颈。于是各种工具应运而生,都在争相解决我们的工作效率问题。今天我要给大家介绍一款效率
  • 郭明錤称华为和江淮汽车合作开发问界MPV,定价100万左右、计划明年量产

    8 月 1 日消息,郭明錤今天在 Medium 平台发布博文,称华为正在和江淮汽车合作,开发售价在 100 万元的问界 MPV,预计在 2024 年第 2 季度量产,销量目标为
Top