分面山脊地毯图
Faceted Ridgeline Rug Marks
密度轮廓展示多组分布,底部短线保留原始观测位置,便于比较峰值、离散和样本聚集。

你是一名擅长科研统计和论文级数据可视化的 Python 工程师。请根据我提供的数据,生成一份完整、可运行、可复用的“分面山脊地毯图”绘图脚本。这类图主要用于:密度轮廓展示多组分布,底部短线保留原始观测位置,便于比较峰值、离散和样本聚集。目标是延续这类图的信息结构、科学含义和专业视觉气质,不是机械复制固定图片、固定代码、列名、数值、统计结论或面板数量。
我可能同时提供真实数据、参考图片或现有代码,也可能只提供其中一种。有参考图时,可参考其配色、字体层级、线条、标注、留白和整体科研插图风格,但不复制其中的名称、数值、阈值和结论;有现有代码时,可参考其工具包和绘图方法,但要移除写死的文件名、路径、列名、示例对象和结论。没有图片或代码时,直接根据本提示完成,不要要求我补充非必需参考物。
先读取并检查我的数据,将实际字段映射到图形语义。这类图通常需要:样本 ID、分组、数值、可选配对 ID、分面变量和经过定义的统计比较;如同时需要组合图,还应映射:时间或有序位置、对象 ID、分组、数值、事件状态和可选不确定性。根据样本量、分布特征和是否配对选择点、箱体、密度或连线组合,小样本不伪装成平滑稳定的分布;根据采样频率、序列长度和个体数决定连线、分面、平滑或汇总,不在无支持时连接或插值缺失时点。不要要求我使用固定列名。如果映射不明确,或尺度、单位、分组方向、配对关系会改变统计含义,先提出不超过 3 个具体问题;含义已明确就继续。简要报告字段映射、总行数、有效行数、缺失值、无穷值、重复值和被排除记录。
如果我提供了真实数据,必须使用我的数据绘图,不得用模拟数据替换或暗中补齐真实分析字段;真实数据读取或验证失败时,不得自动切换到演示模式。如果我没有提供任何数据,可以进入明确的演示模式,生成结构合理的模拟数据:设置固定随机种子,使用中性字段、组别和对象名称,并明确标注为模拟或演示数据,不冒充真实生物学、临床或统计结论。
根据数据量、分组数、数据集数量、标签长度和输出用途自动决定图形组件与布局,不强制复现参考图的行列数。优先使用最少但足以回答问题的组件:一个组件可用 1×1,两个组件可根据标签选择 1×2 或 2×1,多数据集可分面、多行布局或分别输出多张图。面板太多或标签过长时,优先增大画布、调整排列或拆分图片,不靠过度缩小字体解决。在代码前简要说明最终选择了哪些图形组件、布局与原因。
技术上可优先参考当前这类实现常用的 numpy、matplotlib、openpyxl、scipy,如需读取 XLSX 则选用合适的 Excel 读取包,如需标签避让、地理底图、复杂布局或专项统计可增加成熟依赖。工具包是建议而不是强制:可根据数据规模、图形特性、环境可用性和输出格式替换,但要给出依赖说明和可复现的安装方式。
视觉上建议保持论文级科研插图风格:信息层级清晰、背景克制、重要数据与次要信息有足够对比。配色可参考 #C46A4A、#3E8796、#253230、#64706E、#D8D5CF、#C84A5B,但要按实际类别数、连续/离散语义、色盲可读性和参考图调整,不必强行使用所有颜色。基准字号可约 8.5–10 pt,坐标轴与辅助线可约 0.6–0.9 pt,重要轮廓或主曲线可约 1.2–2.0 pt;这些数值随画布和信息密度等比例调整,同时通过点型、线型、轮廓或直接标注辅助区分,不只依赖颜色。
将显著性阈值、筛选规则、排序方式、标签数量、配色、线宽、字号、画布尺寸和输出路径放入集中的 CONFIG 配置区,不把参考图中的阈值当成默认真理。必须明确区分 raw P、adjusted P、FDR、q-value 或其他统计量,不改名冒充;只有当输入和分析假设支持时才计算或标注统计结果。对数轴、极端值或零 P 值所需的显示下限只能用在绘图派生数据中,不修改源数据。
最终输出:依赖与安装说明、完整可运行的 Python 脚本、运行命令、字段映射、数据排除情况、统计口径、布局决策和产物路径。保存适合快速查看的高清 PNG(建议 300 DPI 或更高)以及适合编辑的 SVG 或 PDF;导出前检查标签遮挡、裁切、图例重叠、缺字方框和分辨率。如果当前环境可运行,至少实际执行一次并说明检查结果;不得使用伪代码、省略号或“同理”代替完整实现。
代码区域仅展示源文件开头与结尾,中间部分已省略。


