查看原文
其他

连老司机都不敢随便刷新PG的物化视图

digoal PostgreSQL码农集散地
2024-09-30

文中参考文档点击阅读原文打开, 同时推荐2个学习环境: 

1、懒人Docker镜像, 已打包200+插件:《最好的PostgreSQL学习镜像

2、有web浏览器就能用的云起实验室: 《免费体验PolarDB开源数据库

3、PolarDB开源数据库内核、最佳实践等学习图谱:  https://www.aliyun.com/database/openpolardb/activity 

关注公众号, 持续发布PostgreSQL、PolarDB、DuckDB等相关文章. 


第39期吐槽:PG 物化视图不支持基于log的增量刷新

1、产品的问题点

  • PG 物化视图不支持基于log的增量刷新

2、问题点背后涉及的技术原理

  • PG 的物化视图支持2种刷新方式

    • 堵塞整个全量刷新过程, 而不仅仅是交换底层filenode时.

    • 1、全量刷新, 相当于重建mv, 然后交换底层数据文件filenode. 会堵塞查询.

    • 2、增量刷新, 物化视图必须有UK(唯一索引), 相当于重新计算一次物化视图的内容, 然后逐条与当前物化视图进行比对(类似full outer join), 发现发生变化的行进行更新, 新增的行写入, 删除的行进行删除.

    • oracle mv log技术: https://docs.oracle.com/cd/E18283_01/server.112/e17118/statements_6003.htm

    3、这个问题将影响哪些行业以及业务场景

    • 通常OLAP类场景会使用MV(物化视图)

    4、会导致什么问题?

    • PG 这种基于PK比较(UK diff)的增量刷新需要产生较大查询, 效率更低, 这个操作通常无法频繁进行. 所以无法满足需要较为实时的获得物化视图刷新场景的需求.

    • 增量刷新过程中有merge join的可能, 重新计算变化量时可能会产生大量sort的临时文件.

      • 使用这个方法可以观测到: 《PostgreSQL 兼容Oracle sql_trace 10046 10053 方法 - SQL诊断跟踪》

    5、业务上应该如何避免这个坑

    • 降低增量刷新频率.

    • 使用视图, 而不使用物化视图. 视图是实时计算的.

    6、业务上避免这个坑牺牲了什么, 会引入什么新的问题

    • 降低刷新频率, 用户查询到的物化视图数据可能比较旧, 无法满足业务较为实时的查询需求

    • 放弃使用物化视图, 使用普通视图, 无法享受物化视图(已计算得出结果)带来的速度提升的效果.

    7、数据库未来产品迭代如何修复这个坑

    • 希望内核层面支持mv log, 通过mv log增量刷新不需要重新生成全量物化视图数据做full outer join的逐条比对, 而且两次刷新之间同一条记录如果update多次的话, 刷新时这条记录在物化视图上也只需要更新一次, 从而增量刷新的效率可以大幅度提高, 从而提高物化视图刷新的实时性.

      • https://github.com/sraoss/pgsql-ivm

      • https://github.com/Blazebit/blaze-ivm

      • https://www.postgresql.org/message-id/flat/20181227215726.4d166b4874f8983a641123f5%40sraoss.co.jp



    往期吐槽文章:
    欢迎大家留言或联系我把踩过的坑发过来, 一起鞭策开源和国产数据库: 
    德哥邀你鞭策数据库第1期 - PG MVCC
    Tom Lane老师, 求求你别挤牙膏了, 先解决xid回卷的问题吧
    3 为什么增加只读实例不能提高单条SQL的执行速度?
    4 德哥邀你鞭策数据库第4期-逻辑日志居然只有全局开关
    第5期吐槽:经常OOM?吃内存元凶找到了:元数据缓存居然不能共享
    第6期吐槽:2024了还没用上DIO,不浪费内存才怪呢!
    7 第7期吐槽:今年才等来slot failover,附上海DBA招聘信息
    8 第8期吐槽:高并发短连接性能怎么这么差?
    9 第9期鞭策:“最先进”的开源数据库上万连接就扛不动了,怪研发咯?
    10 第10期吐槽:说删库跑路的都是骗子,千万别信,他们有的宝贝你可能没有!
    11 第11期吐槽:关闭FPW来提升性能,你想过后果吗! 本期彩蛋-老板提出变态的要求,你会答应吗?
    12 第12期吐槽:SQL执行计划不对?能好就见鬼了!优化器还在用几十年前的参数模板,环境自适应能力几乎为零
    13 第13期吐槽:十个中年人有九个发福的,数据库用久了也会变胖!这一期吐槽PG膨胀收缩之痛,tom lane啊您为啥不根治膨胀呢?
    14 吐槽(鞭策)PG以来我掉了“一半流量”!老外听不得忠言逆耳吗? (本期抽奖-掌上游戏机)
    15 第15期吐槽:没有全局临时表,除了难受还有哪些潜在危害?
    16 空缺,因为这一期的吐槽PG社区已经落实了.
    17 第17期吐槽:被DDL坑过的人不计其数!严重时引起雪崩,危害仅次于删库跑路!PG官方不支持online DDL确实后患无穷
    18 第18期吐槽:都走索引了为什么还要回表访问?原来是索引里缺少了“灵魂”
    19 第19期吐槽:从DuckDB导入到PG后膨胀了5倍,把存储销售乐坏了!什么情况?
    20 第20期吐槽:PG17新版本这么香,为什么不升级呢?居然是因为这个
    21 第21期吐槽:90%的性能抖动是缺少这个功能造成的!也是DBA害怕开发去线上跑SQL的魔咒
    22 第22期吐槽:DB容灾节点延迟了,网络带宽瓶颈?用CPU换啊!该“魔法”PG还不支持!
    25 第25期吐槽:PG的物理Standby无法Partial导致单元化架构/SaaS使用不灵活
    99 第99期吐槽:SQL hang住锁阻塞性能暴跌!抓不到捣蛋SQL的DBA很尴尬。
    26 第26期吐槽:开发者使用PG的第1件事-配置访问控制策略,体验有待加强
    27 第27期吐槽:block size既大又小!谁把成年人惯成这样的?
    28 想撼动Oracle,PG系国产你还不配!吐槽你连最基本的空间分配都没做好
    29 吐槽PG表空间搞得跟"玩具"一样,全靠ZFS来凑
    30 快改密码!你的PG密码可能已经泄露了
    31 注意别踩坑!PG大表又发现一处隐患
    100 直播+吐槽: 看看你的PG有没有被注水? 聊聊孤儿文件
    32 第32期吐槽: PG大表激怒架构师,分区后居然不能创建唯一约束?
    33 有奖谜题:PG里100%会爆的定时炸弹是什么?
    34 第34期吐槽:PG做SaaS/DBaaS?隔墙有耳。(本期彩蛋PG岗位招聘)
    35 "富人"的烦恼
    36 PG商业上失败的重要原因之一
    38 猪怕过年,DBA怕什么?

    彩蛋-本周五、六PG中文社区年会



    文章中的参考文档请点击阅读原文获得. 


    欢迎关注我的github (https://github.com/digoal/blog) , 学习数据库不迷路.  

    近期正在写公开课材料, 未来将通过视频号推出, 欢迎关注视频号:


    个人观点,仅供参考
    继续滑动看下一个
    PostgreSQL码农集散地
    向上滑动看下一个

    您可能也对以下帖子感兴趣

    文章有问题?点此查看未经处理的缓存